Inteligência artificial, sem ruído.
Infraestrutura3 min

NVIDIA NIM entrega até 2,5x mais usuários no Nemotron 3 Ultra para cargas agênticas

Otimizações do NVIDIA NIM elevam em até 2,5x a vazão do Nemotron 3 Ultra em cargas agênticas, permitindo servir mais usuários simultâneos no mesmo hardware.

NVIDIA NIM entrega até 2,5x mais usuários no Nemotron 3 Ultra para cargas agênticas

Colocar um modelo de linguagem em produção é só o primeiro passo. O desafio real é servir o maior número possível de usuários simultâneos no hardware de GPU disponível sem abrir mão da responsividade. A NVIDIA anunciou que o Nemotron 3 Ultra NIM entrega até 2,5x mais vazão de sistema em um servidor com 4 GPUs B200, em comparação com uma pilha de inferência de código aberto sem as otimizações do NIM.

O que muda na prática

A diferença é medida em tokens por segundo. Com a pilha otimizada NIM 2.0.12, o sistema atinge 1.997 tokens por segundo contra 718 tokens por segundo da linha de base, em uma carga de trabalho agêntica de 64K de contexto e alvo de 50 TPS por usuário. Em termos diretos: mais usuários concorrentes com a mesma interatividade, no mesmo hardware.

Isso importa especialmente para cargas agênticas, em que prompts são longos, o contexto é reutilizado entre etapas e as aplicações costumam transmitir respostas longas de volta ao usuário. Cada ponto percentual de eficiência ali se traduz em custo de infraestrutura evitado.

Como as otimizações se somam

Os ganhos vêm de pacotes de configuração que interagem entre si, não de chaves independentes. As principais camadas são:

  • Precisão e kernels autotunados: kernels de mixture-of-experts e Mamba ajustados mapeiam a arquitetura híbrida para as GPUs Blackwell.
  • Execução paralela: paralelismo de tensores distribui o modelo entre quatro GPUs, com execução ciente de especialistas.
  • Reuso de prefixo e estado: cache de prefixo evita recomputar contexto repetido, com casamento parcial de prefixo e ajustes no cache de estado do Mamba.
  • Scheduler, batching e memória: limites de sequência, blocos e alocação de GPU mantêm mais trabalho em voo sem estourar a latência alvo.
  • Decodificação especulativa MTP: adiciona ganho incremental que depende da taxa de aceitação e da folga de memória.

O NIM empacota essas escolhas em um microsserviço implantável, com configurações validadas, APIs padrão e ciclo de vida de contêiner pronto para empresa via NVIDIA AI Enterprise. Para produção, o NIM Certified acrescenta atualizações regulares da pilha de inferência, tratamento de CVEs e suporte comercial.

Como medir no seu próprio tráfego

A NVIDIA é enfática: as curvas publicadas são ponto de partida, não promessa de que toda aplicação verá o mesmo resultado. O caminho recomendado é reproduzir tráfego representativo com o NVIDIA AIPerf — usando um trace no formato Mooncake — e construir a curva de Pareto para a métrica de latência que importa para os seus usuários. Só então escolher o ponto que atende o SLO.

O NIM 2.0.12 está disponível no NGC, com perfis otimizados para cargas agênticas em sistemas B200. A NVIDIA planeja mais configurações otimizadas para uma gama mais ampla de modelos, o que dá a equipes de produção pontos de partida validados para seus próprios alvos de latência, vazão e custo.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.