Inteligência artificial, sem ruído.
Modelos e LLMs4 min

AMD lança Instella-MoE-16B-A3B: modelo aberto de 16B com 2.8B de parâmetros ativos

AMD publica o Instella-MoE-16B-A3B, um modelo Mixture-of-Experts totalmente aberto que ativa apenas 2,8 bilhões de parâmetros por token. Pesos de todas as etapas de treinamento, dados e código estão disponíveis.

AMD lança Instella-MoE-16B-A3B: modelo aberto de 16B com 2.8B de parâmetros ativos

AMD lança Instella-MoE-16B-A3B: modelo aberto de 16B com apenas 2.8B de parâmetros ativos

A AMD acaba de publicar o Instella-MoE-16B-A3B, um modelo de linguagem com arquitetura Mixture-of-Experts (MoE) totalmente aberto, treinado do zero em GPUs Instinct MI300X e MI325X. Com 16 bilhões de parâmetros totais, o modelo ativa apenas 2,8 bilhões por token — uma relação de 5,7:1 que o coloca entre os MoEs mais eficientes do mercado aberto.

O diferencial está na transparência: a AMD está publicando os pesos de todas as etapas de treinamento, as misturas de dados, configurações completas e o código de inferência. A empresa também revelou duas inovações arquiteturais que sustentam o lançamento: Gated Multi-head Latent Attention (Gated MLA) e FarSkip-Collective.

Arquitetura: 64 experts, 6 ativos por token

O Instella-MoE é um decoder-only com 27 camadas, hidden size de 2048, 16 cabeças de atenção e um vocabulário de 128.896 tokens. Cada camada MoE usa 2 experts compartilhados mais 6 experts roteados selecionados entre 64 disponíveis, resultando em 2,8B de parâmetros ativos contra 16B totais. O treinamento utiliza o objetivo Multi-Token Prediction durante o pré-treinamento e mid-training.

As duas inovações de sistema são particularmente interessantes:

  • Gated MLA: adiciona um gate de saída leve e aprendido ao mecanismo Multi-head Latent Attention. Uma projeção linear dedicada deriva um gate condicionado pela entrada, aplicado multiplicativamente antes da projeção de saída.
  • FarSkip-Collective: passa ativações desatualizadas e parciais para as camadas MoE e de atenção, sobrepondo a comunicação expert-paralela com a computação. A AMD reporta 12,7% de aceleração no pré-treinamento e até 39,2% de redução no tempo até o primeiro token (TTFT) em serving com paralelismo de experts.

Pipeline de treinamento com 7,1 trilhões de tokens

O pré-treinamento cobre 7,1 trilhões de tokens de corpora abertos, incluindo Nemotron-CC-v2, MegaMath, FineMath, RefineCode e TxT360. O mid-training utiliza Dolma3 Dolmino 100B em três variantes de dados, fundidas por weight averaging. Uma etapa de contexto longo estende a janela de 4K para 64K usando YaRN, um RoPE theta aumentado e document masking.

O pós-treinamento executa SFT em Dolci-Think-SFT-7B mais misturas Nemotron, culminando em um conjunto de 512K exemplos orientado por feedback e direcionado a fraquezas medidas. O DPO segue com atualizações de router bias e a perda auxiliar de balanceamento de carga desativada para evitar degradação. O RL é executado no framework Miles: 1.400 passos de RLVR (instruction-following), seguidos de Multi-Teacher On-Policy Distillation para preservar o desempenho em matemática e código.

Resultados competitivos entre modelos abertos

O checkpoint base alcança média de 76,7 — a mais alta entre modelos totalmente abertos, à frente do Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) e OLMoE-1B-7B (61,9). Fica atrás apenas do Qwen3.5-4B-Base (79,5), que não é totalmente aberto. O modelo lidera em WinoGrande (86,5) e marca 65,7 no HumanEval+.

No pós-treinamento, a trajetória é consistente: SFT (71,58) → DPO (72,67) → Think (73,22), superando Olmo3-7B-Think (71,97), Gemma-4-E4B think (70,47) e Qwen3.5-4B (69,73). O IFEval sobe de 77,08 para 83,70.

Licenciamento: pesquisa sim, comercial não

É importante notar que os pesos são distribuídos sob a licença ResearchRAIL, restrita a uso acadêmico e de pesquisa — este não é um modelo que você pode colocar em produção comercial amanhã. O código de treinamento, por outro lado, está sob licença MIT, sendo o ativo mais reutilizável do lançamento. O modelo requer aproximadamente 32 GB de memória em BF16, cabendo em um único acelerador de alta memória. A AMD disponibiliza código de inferência em SGLang.

Para times de pesquisa, laboratórios universitários e equipes de P&D empresariais com capacidade de GPU em data center, o Instella-MoE oferece uma receita completa e reproduzível de ponta a ponta para treinar um MoE — algo raro em um campo onde a maioria dos laboratórios mantém seus pipelines de treinamento fechados.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.