Inteligência artificial, sem ruído.
Infraestrutura3 min

NVIDIA Vera Rubin NVL72 entrega até 30x mais trabalho por watt em IA agêntica

Novos dados da NVIDIA mostram que a plataforma Vera Rubin NVL72 entrega até 30x mais throughput por megawatt que a GB300 NVL72 em cargas de trabalho agênticas.

NVIDIA Vera Rubin NVL72 entrega até 30x mais trabalho por watt em IA agêntica

A IA agêntica — aquela em que modelos conversam com ferramentas, bancos de dados e subagentes para executar uma tarefa do início ao fim — está mudando a matemática dos data centers. Segundo dados da OpenRouter citados pela NVIDIA, uma carga de trabalho agêntica consome até 15x mais tokens do que uma simples requisição de chat.

O motivo é simples: um agente não faz uma pergunta e recebe uma resposta. Ele pesquisa, chama subagentes, consulta fontes externas e continua raciocinando até concluir a tarefa. A cada passo, o acúmulo de contexto vira entrada para o passo seguinte — e o contexto pode chegar a centenas de milhares de tokens.

30x mais throughput por megawatt

Novos dados de desempenho medidos pela NVIDIA mostram que a plataforma Vera Rubin NVL72 entrega até 30x mais throughput por megawatt do que a GB300 NVL72 em cargas agênticas. Em fábricas de IA com restrição de energia, isso se traduz em 30x mais trabalho por agente com o mesmo consumo de energia.

A medição foi feita com a carga de trabalho SemiAnalysis AgentX, composta por sessões reais de codificação agêntica, preservando crescimento de contexto, chamadas de ferramentas e criação de subagentes. A NVIDIA também reporta 35x menor custo por token em comparação com a geração anterior.

Por que a medição precisou mudar

Cargas agênticas são fundamentalmente diferentes de chat ou resumo de documentos, em que entrada e saída variam de 1K a 8K tokens. Em sessões agênticas, o contexto se acumula ao longo de etapas e pode alcançar centenas de milhares de tokens, com grande variabilidade nos comprimentos de entrada e saída. A avaliação de desempenho, portanto, precisa capturar o fluxo de trabalho completo do agente, não uma única requisição de inferência.

Nos testes do AgentX, a plataforma Blackwell da NVIDIA já liderava em desempenho entre modelos agênticos como Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 e DeepSeek V4 Pro. A GB300 NVL72, por exemplo, entrega até 15x melhor throughput por megawatt do que a arquitetura Hopper.

O que isso significa para o mercado brasileiro

Para empresas que operam ou contratam data centers no Brasil — onde o custo de energia é um fator decisivo — a eficiência energética da infraestrutura de IA deixa de ser detalhe técnico e vira vantagem competitiva. A promessa de “mais trabalho por watt” impacta diretamente o custo de operar agentes em produção, seja em atendimento ao cliente, desenvolvimento de software ou pesquisa.

A NVIDIA ressalta que esses são resultados iniciais e que otimizações contínuas de software devem melhorar ainda mais o desempenho tanto da Vera Rubin NVL72 quanto da GB300 NVL72.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.