Inteligência artificial, sem ruído.
Modelos e LLMs5 min

NVIDIA Lança Audex: Modelo Unificado de Áudio-Texto que Preserva a Inteligência do Backbone

NVIDIA libera o Audex, LLM unificado de áudio-texto com 30B parâmetros que gera fala e sons sem sacrificar a qualidade do raciocínio textual. Arquitetura MoE, codecs duplos e treinamento multi-estágio.

NVIDIA Lança Audex: Modelo Unificado de Áudio-Texto que Preserva a Inteligência do Backbone

A NVIDIA acaba de liberar o Audex (Nemotron-Labs-Audex-30B-A3B), um modelo de linguagem grande (LLM) unificado que entende e gera tanto áudio quanto texto — e consegue fazer isso sem sacrificar a qualidade do raciocínio textual do modelo base. Os checkpoints, junto com uma versão menor Audex-2B, estão disponíveis sob licença não comercial.

O problema do “imposto do texto” nos modelos multimodais

A maioria dos modelos multimodais paga um preço alto quando ganha a capacidade de gerar áudio ou visão: os benchmarks de texto caem significativamente. A equipe de pesquisa da NVIDIA relata que isso acontece até mesmo em modelos que só adicionam saída de fala. O Audex foi projetado especificamente para evitar essa regressão.

O que é o Audex?

O Audex é um decoder Transformer baseado em Mixture-of-Experts (MoE) com 30 bilhões de parâmetros totais, mas apenas 3 bilhões ativados por token. O backbone é o Nemotron-Cascade-2-30B-A3B, um LLM MoE híbrido Mamba-Transformer com 52 camadas, 128 experts roteáveis e 6 experts ativados.

O design é deliberadamente simples: áudio de entrada é codificado e projetado no espaço de embedding de texto. Tokens de texto e tokens de áudio quantizados são tratados de forma uniforme durante a geração. Não há divisão “thinker-talker” nem cascata de modelos empilhados.

Por manter o design simples, o Audex roda em stacks LLM padrão como Megatron-LM para treinamento e vLLM para inferência. Suporta modo instruct e modo thinking, com janela de contexto de até 1 milhão de tokens.

Como o design unificado funciona

Três componentes envolvem o backbone do LLM:

  • Encoder de áudio: usa AF-Whisper do Audio Flamingo 3, compatível com a arquitetura Whisper Large-v3, processando entrada de 16kHz.
  • Adaptadores MLP de duas camadas: mapeiam features de áudio para a dimensão do modelo.
  • Vocabulário estendido: tokens discretos de saída de áudio expandem o vocabulário original de 131.072 para 205.312 tokens.

Para saída de áudio, o Audex usa dois codecs:

  • Fala: X-Codec2 a 50 tokens por segundo, com quantização escalar finita (FSQ) de camada única e codebook de 65.536.
  • Sons não-verbais: X-Codec a 200 tokens por segundo, com quatro camadas de quantização vetorial residual (RVQ).

Treinamento em múltiplos estágios

O Audex não precisa de pré-treinamento de áudio. Ele parte do checkpoint SFT somente texto e adiciona capacidades progressivamente:

  1. SFT de texto
  2. Aquecimento de áudio (embeddings de texto congelados — descongelá-los degradou a qualidade textual nas ablações)
  3. Geração de áudio
  4. Compreensão de áudio

A equipe testou uma receita de estágio único com todos os dados misturados, mas isso quebrou a recuperação de contexto longo no benchmark NIAH. O treinamento multi-estágio evitou esse problema.

Após o SFT, a equipe aplica Cascade RL somente texto e destilação on-policy multi-domínio (MOPD). Tarefas de áudio mostram regressão marginal ou nenhuma após esse RL somente texto, enquanto as pontuações textuais melhoram simultaneamente. O mix de dados combina 157,4 bilhões de tokens de áudio e 320,5 bilhões de tokens de texto.

Benchmarks: competitivo em texto, líder em ASR

Em benchmarks de texto, o Audex acompanha de perto seu backbone: 86,4 no MMLU-Redux contra 86,3 do backbone, e lidera no IMO AnswerBench (81,1 vs 79,3). Pequenas quedas aparecem no MMLU-Pro e GPQA-Diamond.

Comparação de benchmarks de raciocínio e alinhamento. O Qwen3-Omni-30B-A3B-Thinking, de tamanho comparável, mostra quedas significativas versus seu backbone.

Em reconhecimento de fala, o Audex lidera entre os modelos abertos com 6,82 de taxa média de erro de palavra (WER) no leaderboard OpenASR, superando Step-Audio-R1.1-33B (7,91) e Qwen3-Omni-30B-A3B-Thinking (8,00).

Na compreensão de áudio, o cenário é misto: o Audex lidera em MMAU (75,6) e Audio Entailment (95,0), mas fica atrás em MMAR e MMSU. Porém, é um dos poucos modelos abertos que gera áudio geral além de fala.

Casos de uso

  • Call center multilíngue: transcreve chamadas em alemão e traduz para inglês, com saída estruturada indicando idioma de origem, transcrição e tradução.
  • Acessibilidade: text-to-speech com voz fixa para aplicativos de leitura, com WER de apenas 1,70 no Seed-TTS-Eval.
  • Design de som: geração de áudio a partir de legendas como “pássaros cantando na floresta”, produzindo clipes de 10 segundos em 48kHz.
  • Assistente de voz: speech-to-speech em cascata usando um único checkpoint para todas as etapas.

Pontos fortes e limitações

✅ Pontos fortes:

  • Regressão textual marginal ou nenhuma versus o backbone somente texto
  • Modelo unificado único, compatível com Megatron-LM e vLLM
  • Entre os modelos abertos mais fortes, apenas o Audex gera áudio geral além de fala
  • Supera Qwen3.5-35B-A3B em várias tarefas de raciocínio e alinhamento

⚠️ Limitações:

  • Licença NVIDIA OneWay Noncommercial restringe uso comercial
  • Compreensão de áudio mostra lacunas em MMAR e MMSU versus os melhores LLMs de áudio
  • Speech-to-speech é em cascata, não full-duplex nativo
  • RL atual é somente texto; RL áudio-texto é trabalho futuro

Por que isso importa

O Audex representa um avanço significativo na unificação de modalidades sem o trade-off tradicional de perda de qualidade textual. O fato de rodar em stacks padrão como vLLM significa que a comunidade pode experimentar e construir sobre ele imediatamente. A estratégia de treinamento multi-estágio com RL somente texto também oferece um blueprint valioso para outros times que buscam expandir LLMs para novas modalidades.

O código e os pesos estão disponíveis no Hugging Face e o paper técnico no site da NVIDIA.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.

BenchmarkAudex 30B-A3BQwen3.5-35B-A3BQwen3-Omni-30B-A3B-Thinking
HMMT Feb2592,289,060,4
IMO AnswerBench81,174,859,9
LiveCodeBench v685,374,659,2
ArenaHard v281,665,455,1
IFBench (prompt)77,870,252,4