Inteligência artificial, sem ruído.
Modelos e LLMs2 min

NVIDIA Nemotron 3.5 Lightning: modelo de 30B com 3B ativos chega ao Ollama para rodar agentes locais

Novo modelo aberto da NVIDIA usa arquitetura MoE com 1M de contexto e até 4x mais throughput. Roda localmente em RTX, DGX Spark e Apple Silicon via Ollama.

NVIDIA Nemotron 3.5 Lightning: modelo de 30B com 3B ativos chega ao Ollama para rodar agentes locais

NVIDIA lança Nemotron 3.5 Lightning: modelo de 30B com 3B ativos feito para agentes que não param

A NVIDIA acaba de disponibilizar no Ollama o Nemotron 3.5 Lightning, um modelo de linguagem de 30 bilhões de parâmetros com arquitetura híbrida Mixture-of-Experts (MoE) que ativa apenas 3 bilhões de parâmetros por token. A proposta é clara: um modelo otimizado para agentes que ficam rodando continuamente — lendo arquivos, chamando ferramentas, resolvendo tarefas em múltiplas etapas e tentando novamente quando algo falha.

Diferente dos modelos pesados que exigem data centers, o Nemotron 3.5 Lightning foi projetado para rodar localmente em PCs com NVIDIA RTX, workstations RTX PRO, DGX Spark e DGX Station. Para quem se preocupa com privacidade, isso significa que os dados nunca saem do seu dispositivo.

O que torna esse modelo diferente

  • Contexto de 1 milhão de tokens: espaço para históricos longos de ferramentas em fluxos de trabalho multi-turno sem perder o fio da meada
  • Inferência otimizada: usa decodificação especulativa com predição multi-token (MTP) e DFlash/DSpark, entregando até 4x mais throughput que modelos abertos comparáveis
  • Treinado para o ecossistema real: desenvolvido com a Nemotron Coalition, o modelo foi treinado para as ferramentas que desenvolvedores já usam — coding, tool calling, instruction following
  • Totalmente aberto: pesos abertos treinados em datasets abertos, permitindo fine-tuning para tarefas específicas e deploy em qualquer lugar, do edge ao data center

Casos de uso que fazem sentido

O Nemotron 3.5 Lightning brilha em cenários onde velocidade e eficiência importam mais que capacidade bruta:

  • Assistentes pessoais de longa duração: gerenciando e-mail, calendário, projetos e reservas com contexto local privado
  • Subagentes de código: rodando testes, buscando na base de código e aplicando refatorações dentro dos harnesses que você já usa
  • Operações de segurança: enriquecendo alertas, classificando incidentes, consultando logs e preparando descobertas estruturadas para analistas
  • Camada local junto com nuvem: o Nemotron cuida dos passos de alto volume localmente, e um modelo maior hospedado assume os poucos que precisam de mais capacidade

Comece em minutos

Basta ter o Ollama instalado e rodar:

ollama run nemotron-3.5-lightning

O modelo já é compatível com Claude Code, OpenClaw, Hermes Agent e OpenCode. Para usuários de Apple Silicon, a versão nemotron-3.5-lightning:30b-mlx oferece desempenho otimizado.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.