Inteligência artificial, sem ruído.
Modelos e LLMs2 min

Poolside lança Laguna S 2.1: modelo open-weight de 118B compete com gigantes em benchmarks de código

Modelo Mixture-of-Experts ativa apenas 8B parâmetros por token e lidera SWE-Bench Multilingual com 78,5%. Pesos disponíveis no Hugging Face sob licença aberta.

Poolside lança Laguna S 2.1: modelo open-weight de 118B compete com gigantes em benchmarks de código

Modelo open-weight de 118B compete com gigantes fechados

A Poolside lançou o Laguna S 2.1, um modelo open-weight de 118 bilhões de parâmetros voltado para codificação agêntica. O que chama atenção não é apenas o tamanho — é a eficiência: o modelo ativa apenas 8 bilhões de parâmetros por token (cerca de 6,8% do total) graças à arquitetura Mixture-of-Experts (MoE), conseguindo desempenho comparável ao de modelos várias vezes maiores.

Os pesos estão disponíveis no Hugging Face sob licença OpenMDW-1.1, com suporte a BF16, FP8, INT4 e NVFP4, além de conversões oficiais para GGUF e MLX. O modelo é compacto o suficiente para rodar em uma única NVIDIA DGX Spark com 128 GB de memória unificada — na quantização INT4, ocupa apenas 59 GB.

Resultados competitivos em benchmarks de código

No Terminal-Bench 2.1, o Laguna S 2.1 alcança 70,2% com modo de raciocínio ativado — primeiro lugar entre modelos abertos de tamanho divulgado. No SWE-Bench Multilingual, registra 78,5%, liderando a tabela. O destaque mais expressivo está no DeepSWE v1.1, onde atinge 40,4% contra 9,0% do DeepSeek-V4-Pro-Max — com aproximadamente um sexto dos parâmetros ativos.

O treinamento foi concluído em menos de nove semanas, começando em 22 de maio de 2026 em 4.096 GPUs NVIDIA H200. É o primeiro modelo da Poolside a executar reinforcement learning em precisão FP8.

Modo de raciocínio e custo computacional

O Laguna S 2.1 opera em dois modos: sem raciocínio e com raciocínio máximo (padrão). No modo máximo, o modelo define seu próprio orçamento de computação em tempo de teste, com ganhos expressivos: o Terminal-Bench 2.1 sobe de 60,4% para 70,2%, e o DeepSWE salta de 16,5% para 40,4%. O custo é em tokens — trajetórias DeepSWE consomem cerca de 249 mil tokens de conclusão no modo de raciocínio, contra 99 mil sem.

Demonstrações práticas

A equipe publicou três trajetórias não editadas. Em uma delas, o modelo construiu um motor de renderização HTML/CSS funcional a partir de uma pasta vazia — 181 passos em 50 minutos, sem intervenção humana, validando a saída contra o Chromium headless. Em outra, otimizou o próprio harness de agente da Poolside, tornando-o 5,2% mais rápido com redução de ~71% na alocação de memória.

O acesso hospedado está disponível via OpenRouter (grátis até 256K de contexto) e também em Baseten, Kilo, Prime Intellect Prime Lab e ZML. O modelo também roda em vLLM, SGLang e Ollama.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.