Pular para o conteúdo
Criar jogos Notícias Software

NVIDIA lança Nemotron 3.5 Lightning para agentes sempre ativos

Nemotron 3.5 Lightning é um MoE aberto (30B, 3B ativos) da NVIDIA, otimizado para execução de alto volume em agentes sempre ativos, com speculative decodin

NVIDIA apresentou o Nemotron 3.5 Lightning, um modelo Mixture‑of‑Experts (MoE) aberto pensado para a camada de execução de agentes sempre ativos. O modelo tem 30 bilhões de parâmetros e usa cerca de 3 bilhões de parâmetros ativos por token, oferecendo capacidade de modelos maiores com custo computacional menor.

O que é e para que serve

Nemotron 3.5 Lightning foi projetado para tarefas de alto volume e baixa latência: chamadas a ferramentas, validação de resultados e delegação entre subagentes — atividades que dominam o orçamento de tokens em agentes de longa duração. Em vez de usar um modelo de fronteira para cada passo, Lightning atende a essa camada de execução de forma mais eficiente.

Artificial Analysis Intelligence Index versus output speed scatter, with Nemotron 3.5 Lightning in the winning quadrant.

Material oficial divulgado por NVIDIA Developer Blog. Nemotron 3.5 Lightning é um modelo Mixture‑of‑Experts aberto (30B, 3B ativos) otimizado para execução de alto volume em agente

Técnicas e otimizações

O lançamento reúne técnicas já testadas na família Nemotron, incluindo speculative decoding (previsão multi‑token) e versões draft como DSpark e DFlash para cenários distintos de inferência. O modelo também é distribuído com checkpoints NVFP4 e BF16, aproveitando kernels especializados para GPUs NVIDIA. A NVIDIA afirma que Lightning entrega até 4x de velocidade de saída em comparação com modelos de tamanho semelhante, e que, em testes, concluiu 10.000 tarefas com 86% de acurácia cerca de 30% mais rápido que outro modelo de referência.

Chart comparing PinchBench accuracy with time to complete 10,000 tasks. Nemotron 3.5 Lightning reaches similar accuracy

Material oficial divulgado por NVIDIA Developer Blog. Nemotron 3.5 Lightning é um modelo Mixture‑of‑Experts aberto (30B, 3B ativos) otimizado para execução de alto volume em agente

Roteamento e ecossistema

Para encaixar Lightning em sistemas com múltiplos modelos, a NVIDIA lança o NeMo Switchyard, uma biblioteca de roteamento que dirige cada requisição ao modelo mais indicado. A ideia é deixar modelos de raciocínio pesado lidarem com planejamento complexo, enquanto Lightning cuida das chamadas rotineiras e validações.

Illustration showing Nemtron 3 Ultra.

Material oficial divulgado por NVIDIA Developer Blog. Nemotron 3.5 Lightning é um modelo Mixture‑of‑Experts aberto (30B, 3B ativos) otimizado para execução de alto volume em agente

O pacote é publicado de forma aberta: pesos, dados e receitas foram liberados sob a licença OpenMDW‑1.1, e há suporte a fine‑tuning (LoRA, SFT) via NeMo Automodel e NeMo Megatron Bridge, além de ferramentas para treino por reforço (NeMo RL, NeMo Gym) e um dataset agente‑centric chamado Nemotron‑RL Agentic Terminal Pivot.

NVIDIA Developer Blog

Material oficial divulgado por NVIDIA Developer Blog. Nemotron 3.5 Lightning é um modelo Mixture‑of‑Experts aberto (30B, 3B ativos) otimizado para execução de alto volume em agente

Implantação e compatibilidade

Segundo a NVIDIA, o modelo foi pensado para escalas variadas, desde DGX Spark até execução local: Jetson, GeForce RTX 5090 e ferramentas como LM Studio, llama.cpp, Ollama e Unsloth são compatíveis. A empresa aponta também guias de implantação com vLLM, SGLang e TensorRT‑LLM, e disponibiliza pesos em repositórios públicos citados pela própria NVIDIA.

NVIDIA Developer Blog

Material oficial divulgado por NVIDIA Developer Blog. Nemotron 3.5 Lightning é um modelo Mixture‑of‑Experts aberto (30B, 3B ativos) otimizado para execução de alto volume em agente

Conclusão

Nemotron 3.5 Lightning se posiciona como uma opção otimizada para a camada de execução em fluxos agentivos: menor latência, maior vazão e roteamento inteligente prometem reduzir custo e tempo em tarefas repetitivas que sustentam agentes sempre ativos. A NVIDIA oferece documentação, receitas e integração com um ecossistema crescente para developers integrarem o modelo em aplicações agentivas.

Open model launch image.

Material oficial divulgado por NVIDIA Developer Blog. Nemotron 3.5 Lightning é um modelo Mixture‑of‑Experts aberto (30B, 3B ativos) otimizado para execução de alto volume em agente

Fonte: NVIDIA Developer Blog

neriverso

Conteúdo publicado pela equipe Neriverso.