Inteligência artificial, sem ruído.
Modelos e LLMs3 min

NVIDIA comprime Nemotron-3-Super em 38% e dobra throughput com Puzzle 75B

Novo modelo híbrido MoE da NVIDIA reduz parâmetros de 120,7B para 75,3B, mantém a arquitetura Mamba-Transformer e entrega 2,03x mais throughput em servidor. Três checkpoints já estão no Hugging Face.

NVIDIA comprime Nemotron-3-Super em 38% e dobra throughput com Puzzle 75B

A NVIDIA AI lançou o Nemotron-Labs-3-Puzzle-75B-A9B, uma versão comprimida do Nemotron-3-Super que reduz o total de parâmetros de 120,7 bilhões para 75,3 bilhões — uma compressão de 38% — enquanto entrega até 2,03x mais throughput em servidor. O modelo está disponível no Hugging Face em três formatos: BF16, FP8 e NVFP4.

O Nemotron-3-Super é um modelo híbrido Mamba-Transformer MoE (Mixture of Experts) com 12,8 bilhões de parâmetros ativos. O Puzzle-75B-A9B preserva exatamente a mesma arquitetura de 88 blocos — 40 Mamba, 40 MoE e 8 de atenção — mas reduz a capacidade dentro de cada bloco.

Metas de deployment definidas antes da compressão

A equipe da NVIDIA estabeleceu duas metas antes de iniciar a busca de arquitetura:

  1. 2x throughput de servidor a 100 tokens por segundo por usuário
  2. 8 requisições simultâneas de 1M tokens em uma única GPU H100

Ambas foram atingidas. Os ganhos variam conforme o cenário:

CenárioThroughput SuperThroughput PuzzleGanho
50K/2K a ≥100 tok/s5.128 tok/s8.210 tok/s1,60x
8K/64K a ≥100 tok/s20.939 tok/s42.601 tok/s2,03x
8K/64K a ≥125 tok/s13.074 tok/s27.918 tok/s2,14x
Throughput em um nó 8xB200 com decodificação single-step (NVFP4 weights, FP8 KV cache, FP16 Mamba state)

O regime com mais decodificação (8K/64K) obtém os maiores ganhos. O regime com mais prefill (50K/2K) ganha menos — a compressão beneficia principalmente a fase de geração.

De 1 para 8 usuários simultâneos em uma H100

Em contexto de 1 milhão de tokens, a restrição deixa de ser computação e passa a ser memória. O Super em NVFP4 ocupa cerca de 70 GB dos 80 GB de HBM da H100, sobrando espaço para apenas uma requisição de 1M tokens (cada uma adiciona ~4 GB de KV cache).

O Puzzle-75B-A9B reduz o peso para ~44,5 GB, permitindo 8 requisições simultâneas. O throughput agregado de decodificação nessa configuração é cerca de 4x o throughput de uma única requisição do Super.

O que foi comprimido

A compressão usou três técnicas no espaço de busca do framework Puzzletron:

  • Poda de canais intermediários: canais dentro de cada expert MoE são ranqueados por contribuição e podados uniformemente por camada
  • Redução de top-k: o número de experts ativados por token varia por camada, até o máximo de k=22 do modelo original
  • Poda de Mamba SSM: o tamanho do estado SSM caiu de 128 para 96 canais, acelerando o kernel entre 1,2x e 1,3x durante decodificação

As camadas de atenção não foram tocadas — o Nemotron-3-Super já é muito eficiente em KV cache. As camadas Mamba foram podadas uniformemente porque frameworks de inferência atuais não suportam tamanhos de estado SSM diferentes por camada.

O custo da compressão

Toda compressão tem um preço. O Puzzle-75B perde 4,2 pontos no Arena-Hard-V2 e 2,6 pontos no SWE-Bench. Em compensação, métricas como RULER e AA-LCR mal se movem. É um trade-off consciente: sacrifica-se um pouco de qualidade em benchmarks específicos para ganhar muito em eficiência de deployment.

O método Iterative Puzzle (compressão iterativa) superou o Puzzle de etapa única em 0,57 pontos médios no mesmo alvo de compressão, mostrando que refinar gradualmente produz melhores resultados.

Por que isso importa

Modelos grandes são caros de servir. Cada parâmetro extra consome memória, largura de banda e energia. A abordagem da NVIDIA mostra que é possível comprimir um modelo híbrido MoE em quase 40% mantendo a arquitetura original e atingindo metas agressivas de deployment. Para quem serve modelos em produção, isso significa mais usuários por GPU e menor custo por token.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.