NVIDIA lança Nemotron 3.5 Lightning: modelo de 30B com 3B ativos feito para agentes que não param
A NVIDIA acaba de disponibilizar no Ollama o Nemotron 3.5 Lightning, um modelo de linguagem de 30 bilhões de parâmetros com arquitetura híbrida Mixture-of-Experts (MoE) que ativa apenas 3 bilhões de parâmetros por token. A proposta é clara: um modelo otimizado para agentes que ficam rodando continuamente — lendo arquivos, chamando ferramentas, resolvendo tarefas em múltiplas etapas e tentando novamente quando algo falha.
Diferente dos modelos pesados que exigem data centers, o Nemotron 3.5 Lightning foi projetado para rodar localmente em PCs com NVIDIA RTX, workstations RTX PRO, DGX Spark e DGX Station. Para quem se preocupa com privacidade, isso significa que os dados nunca saem do seu dispositivo.
O que torna esse modelo diferente
- Contexto de 1 milhão de tokens: espaço para históricos longos de ferramentas em fluxos de trabalho multi-turno sem perder o fio da meada
- Inferência otimizada: usa decodificação especulativa com predição multi-token (MTP) e DFlash/DSpark, entregando até 4x mais throughput que modelos abertos comparáveis
- Treinado para o ecossistema real: desenvolvido com a Nemotron Coalition, o modelo foi treinado para as ferramentas que desenvolvedores já usam — coding, tool calling, instruction following
- Totalmente aberto: pesos abertos treinados em datasets abertos, permitindo fine-tuning para tarefas específicas e deploy em qualquer lugar, do edge ao data center
Casos de uso que fazem sentido
O Nemotron 3.5 Lightning brilha em cenários onde velocidade e eficiência importam mais que capacidade bruta:
- Assistentes pessoais de longa duração: gerenciando e-mail, calendário, projetos e reservas com contexto local privado
- Subagentes de código: rodando testes, buscando na base de código e aplicando refatorações dentro dos harnesses que você já usa
- Operações de segurança: enriquecendo alertas, classificando incidentes, consultando logs e preparando descobertas estruturadas para analistas
- Camada local junto com nuvem: o Nemotron cuida dos passos de alto volume localmente, e um modelo maior hospedado assume os poucos que precisam de mais capacidade
Comece em minutos
Basta ter o Ollama instalado e rodar:
ollama run nemotron-3.5-lightningO modelo já é compatível com Claude Code, OpenClaw, Hermes Agent e OpenCode. Para usuários de Apple Silicon, a versão nemotron-3.5-lightning:30b-mlx oferece desempenho otimizado.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



