Thinking Machines Lab lança Inkling-Small: 276 bilhões de parâmetros, 12 bilhões ativos e pesos abertos sob Apache 2.0
O Thinking Machines Lab acaba de disponibilizar o Inkling-Small, um modelo Mixture-of-Experts com 276 bilhões de parâmetros totais e apenas 12 bilhões ativos por token — cerca de um quarto do tamanho do Inkling original (975B/41B ativos). O modelo é multimodal, compreende texto, imagens e áudio nativamente, tem janela de contexto de 1 milhão de tokens, e está disponível no Hugging Face sob licença Apache 2.0.
Arquitetura e deploy
O Inkling-Small usa um transformer decoder-only de 42 camadas com backbone feed-forward MoE esparso. Cada token é roteado para 6 de 256 especialistas, mais 2 especialistas compartilhados ativos em todos os tokens. A atenção é híbrida — combina camadas locais e globais. Imagens são divididas em patches de 40×40 pixels e processadas por uma hMLP de quatro camadas; áudio entra como espectrograma dMel via WAV 16 kHz.
O ponto mais relevante para adoção prática: o checkpoint BF16 exige 600 GB de VRAM agregada (4× NVIDIA B300 ou 8× H200), mas o checkpoint quantizado em NVFP4 reduz esse piso para 180 GB, permitindo rodar o modelo em uma única GPU B300 (W4A4) ou em duas H200 (W4A16). Isso coloca um modelo de 276B ao alcance de startups com orçamento de infraestrutura modesto.
Benchmarks: o aluno supera o professor
O Inkling-Small supera o Inkling original em raciocínio e coding agentivo, apesar de ter um quarto dos parâmetros ativos:
- Humanity’s Last Exam (texto): 31,6% (vs 29,7% do Inkling)
- SWE-bench Verified: 80,2% (vs 77,6%)
- Terminal-Bench 2.1: 64,7% (melhor harness)
- Toolathlon Verified: 54,4% (vs 45,5%)
- GPQA Diamond: 89,5%
- AIME 2026: 95,5%
- ARC-AGI-2: 40,1% (vs 36,5%)
O modelo perde em factualidade simples (SimpleQA Verified cai de 43,9% para 20,6%) e em tarefas bancárias estruturadas — um trade-off esperado na compressão de modelos MoE. Nas avaliações multimodais, fica próximo do Inkling: MMMU Pro 74,0%, CharXiv RQ 77,4%, VoiceBench 90,1%.
Segurança e calibração
O Thinking Machines Lab treinou o modelo com RL contra regras de scoring próprias em um corpus de previsões do mundo real, obtendo Brier Index de 61,3 ± 0,46 no ForecastBench (sem busca). Em segurança, StrongREJECT atinge 98,4% e o FORTRESS adversarial chega a 71,6%. O time concluiu que o modelo não apresenta risco material além do ecossistema de pesos abertos existente, mas recomenda moderação adicional (como Llama Guard) em implantações voltadas ao consumidor.
Por que isso importa
O Inkling-Small representa um marco na democratização de modelos de fronteira. Um modelo de 276B que roda em uma única GPU empresarial com pesos totalmente abertos (Apache 2.0) reduz a barreira de entrada para setores regulados — serviços financeiros, saúde, seguros, telecomunicações e setor público — que precisam de capacidade de raciocínio avançada mas não podem depender de APIs de terceiros por questões de compliance.
O fato de o modelo menor superar o maior em coding agentivo também sinaliza uma tendência importante: destilação on-policy e RL pós-treinamento estão se tornando mais eficazes do que simplesmente escalar parâmetros.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



