Inteligência artificial, sem ruído.
Infraestrutura3 min

NVIDIA Vera Rubin entra em produção com promessa de menor custo por token

A nova plataforma de computação para data centers de IA já roda em Google Cloud, Azure, Oracle e CoreWeave com foco em performance por watt.

NVIDIA Vera Rubin entra em produção com promessa de menor custo por token

NVIDIA Vera Rubin entra em produção: tudo sobre o chip que promete o menor custo por token

A NVIDIA está escalando a produção do Vera Rubin NVL72, sua nova plataforma de computação para data centers de IA que promete entregar o menor custo por token do mercado. O anúncio, feito nesta terça-feira (21), revela que racks da nova geração já estão rodando em parceiros como CoreWeave, Google Cloud, Microsoft Azure e Oracle Cloud Infrastructure.

O Vera Rubin não é apenas um chip — é uma plataforma completa “do chip à rede elétrica”, construída sobre a maior e mais madura cadeia de suprimentos em rack já montada. A NVIDIA fala em mais de 350 fábricas em 30 países para atender à demanda de computação para treinamento de modelos de fronteira e inferência em escala.

Performance por watt como diferencial

O foco da NVIDIA com Vera Rubin é claro: eficiência energética que se traduz diretamente em economia para os clientes. Em um momento em que data centers de IA consomem quantidades industriais de energia, cada watt economizado por token gerado representa margem competitiva. A empresa posiciona a plataforma como líder em performance por watt, uma métrica que está se tornando tão importante quanto petaflops brutos.

A arquitetura NVL72 integra 72 GPUs Vera Rubin em um único rack, com interconexão NVLink de alta velocidade. O número 72 não é arbitrário: representa o limite prático de densidade de GPUs que o resfriamento líquido atual consegue suportar em um rack padrão de data center.

Por que o custo por token importa agora

O mercado de IA está mudando rapidamente do paradigma de treinamento para o de inferência em escala. Com agentes de IA sendo invocados centenas de vezes por tarefa e aplicações multimodais exigindo mais processamento, o custo por token se tornou a métrica que define a economia da IA. Empresas que operam serviços de IA em escala — de chatbots a assistentes de código — são extremamente sensíveis a qualquer redução nesse custo.

A NVIDIA domina o mercado de GPUs para IA com mais de 80% de participação, mas enfrenta pressão crescente de chips customizados da Google (TPU), Amazon (Trainium) e Microsoft (Maia), além de startups como Cerebras. O Vera Rubin é a resposta: não apenas mais rápido, mas mais eficiente em custo operacional.

Cadeia de suprimentos sem precedentes

O que diferencia o Vera Rubin de lançamentos anteriores é a escala da cadeia de suprimentos. Com 350 fábricas em 30 países, a NVIDIA está construindo capacidade de produção que nenhum concorrente pode igualar no curto prazo. Isso se traduz em disponibilidade — um fator que tem sido o calcanhar de Aquiles da indústria de chips de IA desde 2023.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.