Inkling: o modelo de quase 1 trilhão de parâmetros que só acorda 4% do cérebro por vez
A Thinking Machines revelou detalhes do Inkling, um modelo de linguagem com 975 bilhões de parâmetros que funciona de maneira radicalmente diferente dos transformers densos convencionais. Em vez de ativar todos os parâmetros para cada token processado, o Inkling aciona apenas 41 bilhões de parâmetros por token — cerca de 4,2% do total.
Como funciona: uma universidade de especialistas
A melhor analogia para entender o Inkling é imaginar uma universidade com 256 departamentos especializados. Quando um token (palavra ou subpalavra) chega para processamento, um roteador não convoca a universidade inteira. Ele seleciona seis departamentos que parecem relevantes para aquele token específico, adiciona dois departamentos “generalistas” que sempre participam, combina o trabalho deles e segue adiante.
Na prática, isso significa que:
- Uma linha de código Python pode ativar um conjunto de especialistas
- Uma frase em grego ativa outro conjunto completamente diferente
- Um rótulo de diagrama ou um trecho de áudio ativa especialistas distintos
O resultado é um modelo com capacidade massiva de armazenamento (os 975 bilhões de parâmetros) mas com custo computacional esparso (apenas 41 bilhões ativos por token). O número total de parâmetros está “perto o suficiente de um trilhão que a distinção interessa mais aos contadores”, como descreve a fonte.
Por que essa arquitetura importa
Modelos densos como GPT-4 e Claude ativam todos os parâmetros para cada token processado — é como acender todas as luzes de um prédio quando você só precisa de uma sala. Isso torna a inferência cara, lenta e energeticamente ineficiente. A abordagem de mistura de especialistas (MoE) do Inkling permite:
✅ Escala sem custo proporcional: você pode adicionar mais “departamentos” (parâmetros totais) sem aumentar o custo por token
✅ Especialização real: diferentes domínios (código, idiomas, áudio) ativam diferentes partes do modelo
✅ Eficiência energética: menos computação por token significa menos consumo elétrico
⚠️ Complexidade de deployment: o roteamento entre 256 especialistas exige infraestrutura de rede sofisticada
⚠️ Treinamento complexo: balancear a carga entre especialistas durante o treinamento é notoriamente difícil
Contexto: a corrida dos modelos esparsos
O Inkling se junta a uma tendência crescente de arquiteturas esparsas. O Mixtral da Mistral (8 especialistas, 2 ativos por token) popularizou a abordagem em 2024. Modelos como DeepSeek-V3 e Grok-3 da xAI também usam mistura de especialistas. A diferença do Inkling é a escala: 256 especialistas é uma ordem de magnitude acima do que estava disponível em código aberto até agora.
A Thinking Machines descreve o Inkling como parte de um esforço para “revitalizar a abordagem de IA de código aberto dos Estados Unidos” — uma referência implícita à vantagem que laboratórios chineses como DeepSeek e Alibaba construíram nesse campo.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



