Inteligência artificial, sem ruído.
Modelos e LLMs3 min

Thinking Machines Lab lança Inkling-Small: 276B de parâmetros, pesos abertos e execução em GPU única

Modelo MoE de 276 bilhões de parâmetros com apenas 12 bilhões ativos por token chega ao Hugging Face sob Apache 2.0. Supera o Inkling original em coding agentivo e roda em uma única B300.

Thinking Machines Lab lança Inkling-Small: 276B de parâmetros, pesos abertos e execução em GPU única

Thinking Machines Lab lança Inkling-Small: 276 bilhões de parâmetros, 12 bilhões ativos e pesos abertos sob Apache 2.0

O Thinking Machines Lab acaba de disponibilizar o Inkling-Small, um modelo Mixture-of-Experts com 276 bilhões de parâmetros totais e apenas 12 bilhões ativos por token — cerca de um quarto do tamanho do Inkling original (975B/41B ativos). O modelo é multimodal, compreende texto, imagens e áudio nativamente, tem janela de contexto de 1 milhão de tokens, e está disponível no Hugging Face sob licença Apache 2.0.

Arquitetura e deploy

O Inkling-Small usa um transformer decoder-only de 42 camadas com backbone feed-forward MoE esparso. Cada token é roteado para 6 de 256 especialistas, mais 2 especialistas compartilhados ativos em todos os tokens. A atenção é híbrida — combina camadas locais e globais. Imagens são divididas em patches de 40×40 pixels e processadas por uma hMLP de quatro camadas; áudio entra como espectrograma dMel via WAV 16 kHz.

O ponto mais relevante para adoção prática: o checkpoint BF16 exige 600 GB de VRAM agregada (4× NVIDIA B300 ou 8× H200), mas o checkpoint quantizado em NVFP4 reduz esse piso para 180 GB, permitindo rodar o modelo em uma única GPU B300 (W4A4) ou em duas H200 (W4A16). Isso coloca um modelo de 276B ao alcance de startups com orçamento de infraestrutura modesto.

Benchmarks: o aluno supera o professor

O Inkling-Small supera o Inkling original em raciocínio e coding agentivo, apesar de ter um quarto dos parâmetros ativos:

  • Humanity’s Last Exam (texto): 31,6% (vs 29,7% do Inkling)
  • SWE-bench Verified: 80,2% (vs 77,6%)
  • Terminal-Bench 2.1: 64,7% (melhor harness)
  • Toolathlon Verified: 54,4% (vs 45,5%)
  • GPQA Diamond: 89,5%
  • AIME 2026: 95,5%
  • ARC-AGI-2: 40,1% (vs 36,5%)

O modelo perde em factualidade simples (SimpleQA Verified cai de 43,9% para 20,6%) e em tarefas bancárias estruturadas — um trade-off esperado na compressão de modelos MoE. Nas avaliações multimodais, fica próximo do Inkling: MMMU Pro 74,0%, CharXiv RQ 77,4%, VoiceBench 90,1%.

Segurança e calibração

O Thinking Machines Lab treinou o modelo com RL contra regras de scoring próprias em um corpus de previsões do mundo real, obtendo Brier Index de 61,3 ± 0,46 no ForecastBench (sem busca). Em segurança, StrongREJECT atinge 98,4% e o FORTRESS adversarial chega a 71,6%. O time concluiu que o modelo não apresenta risco material além do ecossistema de pesos abertos existente, mas recomenda moderação adicional (como Llama Guard) em implantações voltadas ao consumidor.

Por que isso importa

O Inkling-Small representa um marco na democratização de modelos de fronteira. Um modelo de 276B que roda em uma única GPU empresarial com pesos totalmente abertos (Apache 2.0) reduz a barreira de entrada para setores regulados — serviços financeiros, saúde, seguros, telecomunicações e setor público — que precisam de capacidade de raciocínio avançada mas não podem depender de APIs de terceiros por questões de compliance.

O fato de o modelo menor superar o maior em coding agentivo também sinaliza uma tendência importante: destilação on-policy e RL pós-treinamento estão se tornando mais eficazes do que simplesmente escalar parâmetros.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.