A NVIDIA lançou o Nemotron 3.5 Lightning, modelo aberto desenhado para tarefas especializadas de alto volume em agentes de IA — e ele já pode ser implantado no Amazon SageMaker JumpStart sem que você precise configurar a infraestrutura de servidores manualmente.
O Lightning usa uma arquitetura híbrida de Mixture-of-Experts (MoE) com 30 bilhões de parâmetros totais e apenas 3 bilhões ativos por passagem. Na prática, isso significa que ele roda em uma única GPU suportada, mantendo vazão alta em sessões longas e com múltiplas etapas. A NVIDIA reporta até 4x mais vazão e até 30% de conclusão de tarefas mais rápida em workloads agenticos de alto volume.
Nem toda etapa de um agente precisa de um modelo de ponta
Agentes “sempre ligados” executam muitas chamadas ao modelo — para reunir contexto, observar o ambiente, raciocinar e agir. Nem todas essas etapas exigem capacidade de raciocínio de fronteira. Classificar um alerta, extrair campos de um formulário ou conferir um registro contra uma política são tarefas que um modelo menor e especializado resolve bem — e representam grande parte do volume de chamadas.
É aí que entra o conceito de sistema de modelos: rotear cada etapa para o modelo adequado ao custo e à latência. O Lightning foi feito para a ponta de alto volume desse sistema, com janela de contexto de 1 milhão de tokens (para carregar estado acumulado sem re-ancoragem constante) e decodificação especulativa DFlash, que reduz a latência por token.
Precisão mantida com quantização NVFP4
Um dos destaques é a variante NVFP4, que comprime o modelo mantendo a precisão próxima à versão BF16 em boa parte dos benchmarks. Segundo a NVIDIA, os resultados foram medidos sob um harness consistente e podem divergir de números auto-reportados por outros fornecedores.
| Benchmark | BF16 | NVFP4 |
|---|---|---|
| MMLU Pro | 81,94 | 81,62 |
| GPQA Diamond | 75,44 | 75,57 |
| SWE-bench Verified | 51,56 | 52,80 |
| PinchBench | 85,37 | 83,43 |
| IFBench | 71,88 | 72,88 |
Onde usar
O modelo é indicado para o trabalho especializado e de alta frequência dentro de fluxos de agentes: assistentes pessoais (e-mail, agenda, projetos), serviços financeiros (extração de documentos, checagem de regras), operações de cibersegurança (enriquecimento de alertas, classificação de incidentes), telecom e varejo.
Para implantar, basta buscar o modelo no SageMaker JumpStart (IDs huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4 para NVFP4 ou ...-bf16 para BF16) e escolher o tipo de instância, como ml.g6e.24xlarge. Também é possível implantar a partir da página do modelo no Hugging Face ou via SDK Python do SageMaker. Como o modelo é aberto, dá para personalizá-lo com seus próprios dados e manter o controle dos pesos resultantes.
⚠️ Atenção ao custo: implantar o modelo cria um endpoint do SageMaker que gera cobranças enquanto estiver ativo. Delete o endpoint ao terminar para evitar gastos contínuos.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



