A NVIDIA acaba de liberar o Audex (Nemotron-Labs-Audex-30B-A3B), um modelo de linguagem grande (LLM) unificado que entende e gera tanto áudio quanto texto — e consegue fazer isso sem sacrificar a qualidade do raciocínio textual do modelo base. Os checkpoints, junto com uma versão menor Audex-2B, estão disponíveis sob licença não comercial.
O problema do “imposto do texto” nos modelos multimodais
A maioria dos modelos multimodais paga um preço alto quando ganha a capacidade de gerar áudio ou visão: os benchmarks de texto caem significativamente. A equipe de pesquisa da NVIDIA relata que isso acontece até mesmo em modelos que só adicionam saída de fala. O Audex foi projetado especificamente para evitar essa regressão.
O que é o Audex?
O Audex é um decoder Transformer baseado em Mixture-of-Experts (MoE) com 30 bilhões de parâmetros totais, mas apenas 3 bilhões ativados por token. O backbone é o Nemotron-Cascade-2-30B-A3B, um LLM MoE híbrido Mamba-Transformer com 52 camadas, 128 experts roteáveis e 6 experts ativados.
O design é deliberadamente simples: áudio de entrada é codificado e projetado no espaço de embedding de texto. Tokens de texto e tokens de áudio quantizados são tratados de forma uniforme durante a geração. Não há divisão “thinker-talker” nem cascata de modelos empilhados.
Por manter o design simples, o Audex roda em stacks LLM padrão como Megatron-LM para treinamento e vLLM para inferência. Suporta modo instruct e modo thinking, com janela de contexto de até 1 milhão de tokens.
Como o design unificado funciona
Três componentes envolvem o backbone do LLM:
- Encoder de áudio: usa AF-Whisper do Audio Flamingo 3, compatível com a arquitetura Whisper Large-v3, processando entrada de 16kHz.
- Adaptadores MLP de duas camadas: mapeiam features de áudio para a dimensão do modelo.
- Vocabulário estendido: tokens discretos de saída de áudio expandem o vocabulário original de 131.072 para 205.312 tokens.
Para saída de áudio, o Audex usa dois codecs:
- Fala: X-Codec2 a 50 tokens por segundo, com quantização escalar finita (FSQ) de camada única e codebook de 65.536.
- Sons não-verbais: X-Codec a 200 tokens por segundo, com quatro camadas de quantização vetorial residual (RVQ).
Treinamento em múltiplos estágios
O Audex não precisa de pré-treinamento de áudio. Ele parte do checkpoint SFT somente texto e adiciona capacidades progressivamente:
- SFT de texto
- Aquecimento de áudio (embeddings de texto congelados — descongelá-los degradou a qualidade textual nas ablações)
- Geração de áudio
- Compreensão de áudio
A equipe testou uma receita de estágio único com todos os dados misturados, mas isso quebrou a recuperação de contexto longo no benchmark NIAH. O treinamento multi-estágio evitou esse problema.
Após o SFT, a equipe aplica Cascade RL somente texto e destilação on-policy multi-domínio (MOPD). Tarefas de áudio mostram regressão marginal ou nenhuma após esse RL somente texto, enquanto as pontuações textuais melhoram simultaneamente. O mix de dados combina 157,4 bilhões de tokens de áudio e 320,5 bilhões de tokens de texto.
Benchmarks: competitivo em texto, líder em ASR
Em benchmarks de texto, o Audex acompanha de perto seu backbone: 86,4 no MMLU-Redux contra 86,3 do backbone, e lidera no IMO AnswerBench (81,1 vs 79,3). Pequenas quedas aparecem no MMLU-Pro e GPQA-Diamond.
| Benchmark | Audex 30B-A3B | Qwen3.5-35B-A3B | Qwen3-Omni-30B-A3B-Thinking |
|---|---|---|---|
| HMMT Feb25 | 92,2 | 89,0 | 60,4 |
| IMO AnswerBench | 81,1 | 74,8 | 59,9 |
| LiveCodeBench v6 | 85,3 | 74,6 | 59,2 |
| ArenaHard v2 | 81,6 | 65,4 | 55,1 |
| IFBench (prompt) | 77,8 | 70,2 | 52,4 |



