Inteligência artificial, sem ruído.
Modelos e LLMs4 min

Nemotron 3.5 Lightning: NVIDIA lança modelo MoE aberto de 30B com 3B de parâmetros ativos

NVIDIA liberou o Nemotron 3.5 Lightning, modelo MoE de 30B com apenas 3B ativos por token, e a NeMo Switchyard para roteamento inteligente de agentes. Arquitetura híbrida Mamba-2 + Attention, janela de 1M tokens e custo até 74% menor que modelos de fronteira.

Nemotron 3.5 Lightning: NVIDIA lança modelo MoE aberto de 30B com 3B de parâmetros ativos

Nemotron 3.5 Lightning: NVIDIA lança modelo aberto de 30B que roda como se tivesse 3B

A NVIDIA acaba de lançar duas tecnologias que mudam a equação de custo para agentes de IA em produção. O Nemotron 3.5 Lightning é um modelo aberto de 30 bilhões de parâmetros que ativa apenas 3 bilhões por token — arquitetura Mixture-of-Experts (MoE) com Mamba-2 + Attention — e a NeMo Switchyard é uma biblioteca open source que faz o roteamento inteligente entre modelos durante a execução de agentes.

O problema que ambos resolvem é estrutural: agentes de IA de longa duração passam a maior parte do tempo em chamadas de ferramentas, validação de resultados e delegação para subagentes. Enviar cada uma dessas etapas para um modelo de raciocínio de fronteira como Claude Opus ou GPT-5 adiciona custo e latência desnecessários. O Lightning foi projetado exatamente para essa camada de execução — tarefas de alto volume que não exigem raciocínio complexo.

Arquitetura e desempenho

O Lightning é o membro mais leve da família Nemotron 3, com pré-treinamento em mais de 20 trilhões de tokens usando receita NVFP4. A janela de contexto alcança 1 milhão de tokens. A NVIDIA reporta até 4× mais velocidade de saída comparado a modelos de tamanho similar e conclusão 30% mais rápida em 10.000 tarefas do PinchBench, comparado ao Qwen3.6 35B com acurácia comparável.

Resultados do model card (BF16 / NVFP4):

BenchmarkBF16NVFP4
MMLU Pro81,9481,62
GPQA Diamond75,4475,57
SWE-bench Verified51,5652,80
Terminal-Bench 2.124,5823,46
AA-LCR52,0049,19
Benchmarks oficiais do Nemotron 3.5 Lightning. Sampling recomendado: temperatura 1.0 e top_p 0.95.

Velocidade: decodificação especulativa e quantização

Dois mecanismos explicam o ganho de velocidade. Primeiro, decodificação especulativa: a predição multi-token foi incorporada durante uma fase dedicada de pré-treinamento e refinada com MTP-boosting. A NVIDIA também disponibiliza dois modelos draft externos: DSpark (semi-autoregressivo, ideal para DGX Spark) e DFlash (difusão em bloco leve). Segundo, quantização: um checkpoint NVFP4 é distribuído junto com BF16, servindo nativamente Blackwell e Hopper, com extensão para Ampere via kernels W4A16.

NeMo Switchyard: o roteador inteligente

A NeMo Switchyard é uma biblioteca open source que decide, a cada etapa do fluxo de um agente, qual modelo deve processar a requisição. Oferece roteadores sem necessidade de fine-tuning: um classificador LLM com afinidade de sessão, um roteador de estágio que lê atividade recente de ferramentas, e um roteador de escalonamento que começa com modelos baratos e promove para modelos de fronteira quando a dificuldade persiste.

A LangChain fez benchmark com 145 tarefas multi-turno de agentes. Roteando entre Lightning e Claude Opus 4.8 com o roteador de escalonamento, o custo caiu 74% comparado a usar apenas o modelo de fronteira — apenas 7% das chamadas foram para o Opus, com perda de acurácia de aproximadamente 6 pontos. A Cognition implementou roteamento em estágios no Devin Desktop: no FrontierCode Main, roteando entre Opus 5 e Kimi K2.7, atingiu 50,6% com custo médio de US$ 3,11 — diferença de apenas 2,8 pontos do Opus 5 puro, com custo ~28% menor.

Quem já está usando

Empresas como CrowdStrike (cibersegurança), Harvey (jurídico), CodeRabbit (revisão de código), Fastino Labs (finanças) e Lila Sciences (saúde e ciências da vida) já estão customizando o Lightning. O modelo é distribuído sob a licença permissiva OpenMDW-1.1, com pesos, dados de treinamento e receitas abertos — pronto para uso comercial.

Implantação

O Lightning roda em uma única GPU moderna: 1× DGX Spark (GB10) ou 1× H100. Times que preferem cloud podem servir via Baseten, Together AI ou Nebius. Empresas reguladas mantêm tudo on-premises. Isso coloca desenvolvedores solo e startups na mesma capacidade de execução que grandes enterprises.

Por que isso importa

O Lightning e o Switchyard representam uma mudança de paradigma: em vez de um modelo monolítico que faz tudo, a arquitetura de agentes do futuro usa modelos especializados em camadas — um modelo de planejamento (como Nemotron 3 Ultra) orquestra, enquanto modelos de execução como o Lightning processam o alto volume de chamadas rotineiras. O Switchyard gerencia o tráfego entre eles automaticamente. Para o ecossistema brasileiro de IA, isso significa que agentes autônomos acessíveis estão se tornando viáveis sem depender exclusivamente de APIs caras de fronteira.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.