A NVIDIA revelou que seu stack de software de inferência — codesenhado com GPUs, CPUs, redes e sistemas — já reduziu o custo por token em até 5 vezes na plataforma Blackwell com o modelo DeepSeek V4, em apenas um mês de otimizações contínuas.
À medida que organizações migram de pilotos de IA para fábricas de IA em produção, a métrica que importa não são mais especificações de pico dos chips, mas o custo por token: quantos tokens úteis cada dólar e cada watt podem entregar dentro das metas de latência necessárias. O stack da NVIDIA ataca exatamente essa equação.
Empresas já estão colhendo os ganhos
Líderes do setor de inferência relatam resultados expressivos no Blackwell:
- Baseten: usou a biblioteca open source TensorRT-LLM para servir DeepSeek V4 Pro no Blackwell, aplicando otimizações proprietárias de runtime que entregam até 50% mais tokens por segundo em workloads de raciocínio, código e contexto longo.
- Cognition: utiliza o framework NVIDIA Dynamo para gerenciar GPUs de inferência, obtendo um caminho pronto para escalar workloads de aprendizado por reforço sem construir infraestrutura do zero.
- Deep Infra: serve modelos open source de fronteira no Blackwell desde o dia zero, incluindo DeepSeek V4.
- Together AI: usou TensorRT-LLM no Blackwell para ajudar o Cursor a acelerar o caminho de otimizações de modelo até endpoints de produção em sua experiência de codificação em tempo real.
Por que o software importa mais que o hardware
Workloads de IA agentiva são diferentes de aplicações web tradicionais. Um único pedido de um agente pode disparar centenas de subagentes, milhares de tarefas e múltiplos LLMs rodando em GPUs, CPUs, DPUs e sistemas de armazenamento. A stack de software da NVIDIA conecta três camadas: operação de produção (orquestração distribuída e autoscaling), aceleração de aplicação (overlap de computação/comunicação, kernel fusion) e acesso à infraestrutura (exposição das capacidades do hardware sem exigir que o desenvolvedor gerencie cada dispositivo).
Quando essas camadas operam como um sistema integrado, otimizações individuais se multiplicam. Serving desagregado, paralelismo de experts via NVLink, precisão NVFP4 e previsão de múltiplos tokens podem, juntos, aumentar o throughput em até 20 vezes.
O flywheel do open source
Frameworks como PyTorch, vLLM e SGLang são construídos nativamente sobre CUDA, o que significa que novas pesquisas rodam com performance máxima em GPUs NVIDIA desde o primeiro dia. Quando um modelo de fronteira como DeepSeek V4 é lançado, receitas de deployment para Blackwell estão prontas em horas. O resultado: mais desenvolvedores otimizam caminhos de inferência CUDA-nativos, mais deploys de produção alimentam o ecossistema, e o custo por token continua caindo.
Fonte: NVIDIA Blog
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



