A NVIDIA anunciou em 2 de outubro de 2026 uma versão de 64 GB de memória unificada do DGX Spark, seu computador compacto para IA local. A configuração será vendida a partir de 23 de outubro por parceiros como Acer, ASUS, Dell, Gigabyte, HP e MSI, com preço inicial de US$ 4.999 nos Estados Unidos. Segundo a empresa, uma unidade pode executar localmente modelos de até 100 bilhões de parâmetros; duas máquinas conectadas podem agrupar 128 GB e ampliar o suporte declarado para até 200 bilhões de parâmetros.
O anúncio importa porque reduz a barreira de memória para equipes que querem testar inferência, agentes e ajuste fino perto dos próprios dados, sem que toda experiência dependa de uma instância em nuvem. Mas não transforma o DGX Spark em uma alternativa universal ao data center: preço, energia, disponibilidade no Brasil, desempenho por modelo e custo de operação continuam sendo variáveis decisivas.
O que a NVIDIA está lançando
O novo SKU preserva o GB10 Grace Blackwell Superchip, o DGX OS e a pilha de software de IA da versão de 128 GB, mas chega com 64 GB de memória unificada. A NVIDIA descreve o equipamento como uma plataforma para agentes, inferência, ajuste fino, ciência de dados e desenvolvimento de borda. O ponto central não é apenas caber um modelo na memória: é manter o processamento e os dados no ambiente local quando isso for conveniente para o projeto.
O DGX Spark traz rede NVIDIA ConnectX-7 integrada. Para quem precisa crescer, duas unidades podem ser ligadas diretamente por cabo QSFP. A proposta do NVIDIA Sync Cluster Assistant é detectar a ligação, validar a configuração e preparar a rede para que os dois sistemas trabalhem como um pequeno cluster, sem reconfigurar a pilha de software manualmente.
Capacidade declarada e o que ela significa
| Configuração | Memória unificada | Suporte declarado pela NVIDIA | Uso mais plausível |
|---|---|---|---|
| Um DGX Spark 64 GB | 64 GB | Modelos de até 100 bilhões de parâmetros | Inferência local, prototipagem e agentes com dados privados |
| Dois DGX Spark 64 GB com NVIDIA Sync | 128 GB agrupados | Modelos de até 200 bilhões de parâmetros | Modelos maiores, contextos mais longos ou mais tarefas simultâneas |
| DGX Spark 128 GB | 128 GB | Mesma faixa de memória do par de 64 GB | Implantação compacta sem administrar dois equipamentos |
É importante ler esses números com precisão. “Suportar” um modelo não equivale a entregar uma experiência rápida em qualquer cenário. A memória necessária muda com quantização, tamanho do contexto, cache de atenção, lote de requisições e ferramentas usadas pelo agente. Um modelo de 100 bilhões de parâmetros pode exigir escolhas de precisão e de contexto que não servem a todos os usos. A NVIDIA não publicou neste anúncio uma tabela completa de tokens por segundo para cada modelo e configuração.
Em seu teste com o Qwen 3.8 27B, a empresa afirma que duas unidades de 64 GB chegaram a até 1,7 vez o desempenho de um sistema único. É uma medição do fornecedor, não um benchmark independente generalizável: ela ajuda a entender a direção do ganho, mas não permite concluir que qualquer carga terá aceleração idêntica.
Como o software pretende reduzir a complexidade
O pacote anunciado inclui suporte a NVIDIA Agent Toolkit, bibliotecas CUDA-X AI, modelos abertos Nemotron e runtimes conhecidos como Ollama, vLLM e PyTorch com CUDA. O NVIDIA Sync Model Launcher, previsto para o fim de outubro, deve baixar e iniciar o Qwen3.8 27B em uma máquina ou no cluster, além de configurar o OpenCode para utilizar o modelo a partir do navegador.
A integração é relevante para desenvolvedores porque configurar rede de alta velocidade, drivers, runtime de inferência e roteamento de carga costuma ser a parte menos visível — e mais demorada — de uma implantação local. Ainda assim, o assistente de cluster não substitui governança: equipes continuam responsáveis por controle de acesso, cópias de segurança, observabilidade, atualização de modelos e avaliação dos resultados gerados.
Onde a proposta pode fazer sentido
- Dados que não devem sair do ambiente controlado: análise documental, protótipos internos e fluxos de pesquisa podem reduzir a transferência de conteúdo para APIs externas.
- Desenvolvimento de agentes: uma máquina dedicada permite manter testes de ferramentas, recuperação de documentos e avaliações em execução sem disputar recursos com a estação de trabalho principal.
- Inferência para equipes criativas: a NVIDIA cita modelos de linguagem e imagem, enquanto o Blender prepara suporte para a plataforma.
- Escala gradual: quem começa com um sistema pode, em tese, acrescentar a segunda unidade ao enfrentar modelos maiores, janelas de contexto extensas ou várias requisições concorrentes.
Preço, disponibilidade e limitações para o Brasil
O valor inicial divulgado é de US$ 4.999, antes de impostos, frete, margem de distribuição e câmbio. A NVIDIA não informou, no comunicado consultado, preço nem data de disponibilidade no Brasil. Portanto, não é correto converter automaticamente o preço americano em uma oferta local. Para uma empresa brasileira, a comparação real deve incluir garantia, suporte do parceiro, consumo elétrico, espaço, ruído, conectividade, depreciação e a alternativa de pagar por GPU em nuvem apenas quando houver demanda.
Também há um limite estratégico: um par de equipamentos locais oferece previsibilidade e privacidade, mas não tem a elasticidade de uma frota de GPUs. Cargas sazonais, treinamento de modelos grandes ou atendimento público com picos imprevisíveis continuam podendo exigir nuvem ou arquitetura híbrida. A compatibilidade “pronta para uso” é valiosa, mas não elimina testes com o modelo, o contexto e as ferramentas que cada organização realmente pretende usar.
Análise do NoticIA: a disputa passa da GPU para a operação local
Na análise do NoticIA, o aspecto mais interessante do anúncio não é somente reduzir a memória de 128 GB para 64 GB. É a tentativa de transformar dois computadores em uma unidade operacional por meio do Sync, preservando o mesmo ambiente de software. Se essa experiência funcionar de modo confiável, ela pode tornar mais viável para pequenas equipes adiar a migração para infraestrutura de cluster convencional.
O contraponto é que a promessa precisa ser avaliada em fluxos reais, não apenas por capacidade nominal. Empresas que lidam com dados sensíveis devem testar isolamento, logs, atualização e permissões de agentes; times que precisam de escala devem medir latência e custo total contra opções de nuvem. A configuração de 64 GB amplia a escolha, mas não resolve automaticamente a decisão entre operar localmente e alugar capacidade.
O que acompanhar a partir de 23 de outubro
Antes de planejar uma compra, vale confirmar quais parceiros terão estoque, quais modelos e versões de software serão efetivamente compatíveis, como o NVIDIA Sync se comporta em cargas concorrentes e quais condições de suporte estarão disponíveis na região. Para quem já usa Ollama, vLLM, PyTorch ou llama.cpp, a pergunta prática será menos “o modelo cabe?” e mais “qual combinação de modelo, contexto e simultaneidade entrega qualidade e tempo de resposta aceitáveis no meu fluxo?”.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



