Inteligência artificial, sem ruído.
Infraestrutura3 min

Stack de inferência da NVIDIA reduz custo por token em 5x no Blackwell com DeepSeek V4

Stack de inferência da NVIDIA reduz custo por token em 5x na plataforma Blackwell. Baseten, Cognition, Deep Infra e Together AI já relatam ganhos expressivos em produção.

Stack de inferência da NVIDIA reduz custo por token em 5x no Blackwell com DeepSeek V4
Imagem de apoio. Fonte: NVIDIA Blog.

A NVIDIA revelou que seu stack de software de inferência — codesenhado com GPUs, CPUs, redes e sistemas — já reduziu o custo por token em até 5 vezes na plataforma Blackwell com o modelo DeepSeek V4, em apenas um mês de otimizações contínuas.

À medida que organizações migram de pilotos de IA para fábricas de IA em produção, a métrica que importa não são mais especificações de pico dos chips, mas o custo por token: quantos tokens úteis cada dólar e cada watt podem entregar dentro das metas de latência necessárias. O stack da NVIDIA ataca exatamente essa equação.

Empresas já estão colhendo os ganhos

Líderes do setor de inferência relatam resultados expressivos no Blackwell:

  • Baseten: usou a biblioteca open source TensorRT-LLM para servir DeepSeek V4 Pro no Blackwell, aplicando otimizações proprietárias de runtime que entregam até 50% mais tokens por segundo em workloads de raciocínio, código e contexto longo.
  • Cognition: utiliza o framework NVIDIA Dynamo para gerenciar GPUs de inferência, obtendo um caminho pronto para escalar workloads de aprendizado por reforço sem construir infraestrutura do zero.
  • Deep Infra: serve modelos open source de fronteira no Blackwell desde o dia zero, incluindo DeepSeek V4.
  • Together AI: usou TensorRT-LLM no Blackwell para ajudar o Cursor a acelerar o caminho de otimizações de modelo até endpoints de produção em sua experiência de codificação em tempo real.

Por que o software importa mais que o hardware

Workloads de IA agentiva são diferentes de aplicações web tradicionais. Um único pedido de um agente pode disparar centenas de subagentes, milhares de tarefas e múltiplos LLMs rodando em GPUs, CPUs, DPUs e sistemas de armazenamento. A stack de software da NVIDIA conecta três camadas: operação de produção (orquestração distribuída e autoscaling), aceleração de aplicação (overlap de computação/comunicação, kernel fusion) e acesso à infraestrutura (exposição das capacidades do hardware sem exigir que o desenvolvedor gerencie cada dispositivo).

Quando essas camadas operam como um sistema integrado, otimizações individuais se multiplicam. Serving desagregado, paralelismo de experts via NVLink, precisão NVFP4 e previsão de múltiplos tokens podem, juntos, aumentar o throughput em até 20 vezes.

O flywheel do open source

Frameworks como PyTorch, vLLM e SGLang são construídos nativamente sobre CUDA, o que significa que novas pesquisas rodam com performance máxima em GPUs NVIDIA desde o primeiro dia. Quando um modelo de fronteira como DeepSeek V4 é lançado, receitas de deployment para Blackwell estão prontas em horas. O resultado: mais desenvolvedores otimizam caminhos de inferência CUDA-nativos, mais deploys de produção alimentam o ecossistema, e o custo por token continua caindo.

Fonte: NVIDIA Blog


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.