NVIDIA apresentou o Nemotron 3.5 Lightning, um modelo Mixture‑of‑Experts (MoE) aberto pensado para a camada de execução de agentes sempre ativos. O modelo tem 30 bilhões de parâmetros e usa cerca de 3 bilhões de parâmetros ativos por token, oferecendo capacidade de modelos maiores com custo computacional menor.
O que é e para que serve
Nemotron 3.5 Lightning foi projetado para tarefas de alto volume e baixa latência: chamadas a ferramentas, validação de resultados e delegação entre subagentes — atividades que dominam o orçamento de tokens em agentes de longa duração. Em vez de usar um modelo de fronteira para cada passo, Lightning atende a essa camada de execução de forma mais eficiente.

Técnicas e otimizações
O lançamento reúne técnicas já testadas na família Nemotron, incluindo speculative decoding (previsão multi‑token) e versões draft como DSpark e DFlash para cenários distintos de inferência. O modelo também é distribuído com checkpoints NVFP4 e BF16, aproveitando kernels especializados para GPUs NVIDIA. A NVIDIA afirma que Lightning entrega até 4x de velocidade de saída em comparação com modelos de tamanho semelhante, e que, em testes, concluiu 10.000 tarefas com 86% de acurácia cerca de 30% mais rápido que outro modelo de referência.

Roteamento e ecossistema
Para encaixar Lightning em sistemas com múltiplos modelos, a NVIDIA lança o NeMo Switchyard, uma biblioteca de roteamento que dirige cada requisição ao modelo mais indicado. A ideia é deixar modelos de raciocínio pesado lidarem com planejamento complexo, enquanto Lightning cuida das chamadas rotineiras e validações.

O pacote é publicado de forma aberta: pesos, dados e receitas foram liberados sob a licença OpenMDW‑1.1, e há suporte a fine‑tuning (LoRA, SFT) via NeMo Automodel e NeMo Megatron Bridge, além de ferramentas para treino por reforço (NeMo RL, NeMo Gym) e um dataset agente‑centric chamado Nemotron‑RL Agentic Terminal Pivot.

Implantação e compatibilidade
Segundo a NVIDIA, o modelo foi pensado para escalas variadas, desde DGX Spark até execução local: Jetson, GeForce RTX 5090 e ferramentas como LM Studio, llama.cpp, Ollama e Unsloth são compatíveis. A empresa aponta também guias de implantação com vLLM, SGLang e TensorRT‑LLM, e disponibiliza pesos em repositórios públicos citados pela própria NVIDIA.

Conclusão
Nemotron 3.5 Lightning se posiciona como uma opção otimizada para a camada de execução em fluxos agentivos: menor latência, maior vazão e roteamento inteligente prometem reduzir custo e tempo em tarefas repetitivas que sustentam agentes sempre ativos. A NVIDIA oferece documentação, receitas e integração com um ecossistema crescente para developers integrarem o modelo em aplicações agentivas.

Fonte: NVIDIA Developer Blog
