Modelo open-weight de 118B compete com gigantes fechados
A Poolside lançou o Laguna S 2.1, um modelo open-weight de 118 bilhões de parâmetros voltado para codificação agêntica. O que chama atenção não é apenas o tamanho — é a eficiência: o modelo ativa apenas 8 bilhões de parâmetros por token (cerca de 6,8% do total) graças à arquitetura Mixture-of-Experts (MoE), conseguindo desempenho comparável ao de modelos várias vezes maiores.
Os pesos estão disponíveis no Hugging Face sob licença OpenMDW-1.1, com suporte a BF16, FP8, INT4 e NVFP4, além de conversões oficiais para GGUF e MLX. O modelo é compacto o suficiente para rodar em uma única NVIDIA DGX Spark com 128 GB de memória unificada — na quantização INT4, ocupa apenas 59 GB.
Resultados competitivos em benchmarks de código
No Terminal-Bench 2.1, o Laguna S 2.1 alcança 70,2% com modo de raciocínio ativado — primeiro lugar entre modelos abertos de tamanho divulgado. No SWE-Bench Multilingual, registra 78,5%, liderando a tabela. O destaque mais expressivo está no DeepSWE v1.1, onde atinge 40,4% contra 9,0% do DeepSeek-V4-Pro-Max — com aproximadamente um sexto dos parâmetros ativos.
O treinamento foi concluído em menos de nove semanas, começando em 22 de maio de 2026 em 4.096 GPUs NVIDIA H200. É o primeiro modelo da Poolside a executar reinforcement learning em precisão FP8.
Modo de raciocínio e custo computacional
O Laguna S 2.1 opera em dois modos: sem raciocínio e com raciocínio máximo (padrão). No modo máximo, o modelo define seu próprio orçamento de computação em tempo de teste, com ganhos expressivos: o Terminal-Bench 2.1 sobe de 60,4% para 70,2%, e o DeepSWE salta de 16,5% para 40,4%. O custo é em tokens — trajetórias DeepSWE consomem cerca de 249 mil tokens de conclusão no modo de raciocínio, contra 99 mil sem.
Demonstrações práticas
A equipe publicou três trajetórias não editadas. Em uma delas, o modelo construiu um motor de renderização HTML/CSS funcional a partir de uma pasta vazia — 181 passos em 50 minutos, sem intervenção humana, validando a saída contra o Chromium headless. Em outra, otimizou o próprio harness de agente da Poolside, tornando-o 5,2% mais rápido com redução de ~71% na alocação de memória.
O acesso hospedado está disponível via OpenRouter (grátis até 256K de contexto) e também em Baseten, Kilo, Prime Intellect Prime Lab e ZML. O modelo também roda em vLLM, SGLang e Ollama.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



