AMD lança Instella-MoE-16B-A3B: modelo aberto de 16B com apenas 2.8B de parâmetros ativos
A AMD acaba de publicar o Instella-MoE-16B-A3B, um modelo de linguagem com arquitetura Mixture-of-Experts (MoE) totalmente aberto, treinado do zero em GPUs Instinct MI300X e MI325X. Com 16 bilhões de parâmetros totais, o modelo ativa apenas 2,8 bilhões por token — uma relação de 5,7:1 que o coloca entre os MoEs mais eficientes do mercado aberto.
O diferencial está na transparência: a AMD está publicando os pesos de todas as etapas de treinamento, as misturas de dados, configurações completas e o código de inferência. A empresa também revelou duas inovações arquiteturais que sustentam o lançamento: Gated Multi-head Latent Attention (Gated MLA) e FarSkip-Collective.
Arquitetura: 64 experts, 6 ativos por token
O Instella-MoE é um decoder-only com 27 camadas, hidden size de 2048, 16 cabeças de atenção e um vocabulário de 128.896 tokens. Cada camada MoE usa 2 experts compartilhados mais 6 experts roteados selecionados entre 64 disponíveis, resultando em 2,8B de parâmetros ativos contra 16B totais. O treinamento utiliza o objetivo Multi-Token Prediction durante o pré-treinamento e mid-training.
As duas inovações de sistema são particularmente interessantes:
- Gated MLA: adiciona um gate de saída leve e aprendido ao mecanismo Multi-head Latent Attention. Uma projeção linear dedicada deriva um gate condicionado pela entrada, aplicado multiplicativamente antes da projeção de saída.
- FarSkip-Collective: passa ativações desatualizadas e parciais para as camadas MoE e de atenção, sobrepondo a comunicação expert-paralela com a computação. A AMD reporta 12,7% de aceleração no pré-treinamento e até 39,2% de redução no tempo até o primeiro token (TTFT) em serving com paralelismo de experts.
Pipeline de treinamento com 7,1 trilhões de tokens
O pré-treinamento cobre 7,1 trilhões de tokens de corpora abertos, incluindo Nemotron-CC-v2, MegaMath, FineMath, RefineCode e TxT360. O mid-training utiliza Dolma3 Dolmino 100B em três variantes de dados, fundidas por weight averaging. Uma etapa de contexto longo estende a janela de 4K para 64K usando YaRN, um RoPE theta aumentado e document masking.
O pós-treinamento executa SFT em Dolci-Think-SFT-7B mais misturas Nemotron, culminando em um conjunto de 512K exemplos orientado por feedback e direcionado a fraquezas medidas. O DPO segue com atualizações de router bias e a perda auxiliar de balanceamento de carga desativada para evitar degradação. O RL é executado no framework Miles: 1.400 passos de RLVR (instruction-following), seguidos de Multi-Teacher On-Policy Distillation para preservar o desempenho em matemática e código.
Resultados competitivos entre modelos abertos
O checkpoint base alcança média de 76,7 — a mais alta entre modelos totalmente abertos, à frente do Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) e OLMoE-1B-7B (61,9). Fica atrás apenas do Qwen3.5-4B-Base (79,5), que não é totalmente aberto. O modelo lidera em WinoGrande (86,5) e marca 65,7 no HumanEval+.
No pós-treinamento, a trajetória é consistente: SFT (71,58) → DPO (72,67) → Think (73,22), superando Olmo3-7B-Think (71,97), Gemma-4-E4B think (70,47) e Qwen3.5-4B (69,73). O IFEval sobe de 77,08 para 83,70.
Licenciamento: pesquisa sim, comercial não
É importante notar que os pesos são distribuídos sob a licença ResearchRAIL, restrita a uso acadêmico e de pesquisa — este não é um modelo que você pode colocar em produção comercial amanhã. O código de treinamento, por outro lado, está sob licença MIT, sendo o ativo mais reutilizável do lançamento. O modelo requer aproximadamente 32 GB de memória em BF16, cabendo em um único acelerador de alta memória. A AMD disponibiliza código de inferência em SGLang.
Para times de pesquisa, laboratórios universitários e equipes de P&D empresariais com capacidade de GPU em data center, o Instella-MoE oferece uma receita completa e reproduzível de ponta a ponta para treinar um MoE — algo raro em um campo onde a maioria dos laboratórios mantém seus pipelines de treinamento fechados.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



