NVIDIA ampliou sua família Nemotron com o Nemotron 3.5 Lightning, um modelo aberto de mistura de especialistas (MoE) projetado para alimentar agentes locais mais rápidos e personalizáveis. A empresa destaca ganhos de desempenho frente a modelos abertos da mesma classe: até 4x mais velocidade na geração de tokens e 30% de redução no tempo de conclusão.
O que é Nemotron 3.5 Lightning
Nemotron 3.5 Lightning é um modelo de 30 bilhões de parâmetros com pesos abertos, o que permite que desenvolvedores e entusiastas façam fine-tuning com seus próprios exemplos. A NVIDIA cita usos diretos para essa personalização, como adaptar tom e formato de textos, aprender jargões e tarefas de nicho (fotografia, design 3D, jogos) e seguir convenções de código em assistentes para programadores.
Ecossistema e implantação local
Para facilitar o uso local, a NVIDIA trabalhou com projetos e ferramentas da comunidade — entre eles vLLM, Ollama, llama.cpp e LM Studio — e oferece modelos nos formatos NVFP4 e GGUF. A Unsloth fornece suporte de lançamento com modelos otimizados e quantizados via Unsloth Studio. Nemotron 3.5 Lightning pode rodar em uma gama de hardware: desde PCs com NVIDIA RTX e dispositivos Jetson até estações de trabalho RTX PRO, DGX Station e infraestruturas para data center. A linha Blackwell aparece disponível em parceiros OEM listados pela NVIDIA.
O modelo também está acessível por meio de OpenRouter, como microserviço NIM no build.nvidia.com e através de diversos parceiros de nuvem, plataformas de pós-treinamento e provedores de inferência.
NeMo Switchyard: roteamento para eficiência
Além do modelo, a NVIDIA apresentou o NeMo Switchyard, uma biblioteca de roteamento open source que encaminha cada etapa de um fluxo de agente ao modelo mais adequado com base em precisão, velocidade e custo. Em benchmarks internos, o roteamento entre modelos via NeMo Switchyard manteve desempenho de nível de fronteira enquanto reduziu o custo de conclusão de benchmarks para cerca de um terço comparado ao uso isolado de um modelo (Opus 4.8). NeMo Switchyard está disponível no GitHub.

O que muda para desenvolvedores e criadores de jogos
A combinação de pesos abertos, formatos otimizados e compatibilidade com ferramentas comunitárias facilita experimentação local e integração com aplicativos e arquivos. Isso permite criar agentes para gestão de e‑mail e calendário, automação doméstica e companheiros de codificação que operam no ambiente local do usuário, com possibilidades de personalização mais profundas sem depender exclusivamente de serviços na nuvem.
Para começar com implantação de borda e exemplos práticos, a NVIDIA indica recursos como os tutoriais do Jetson AI Lab e blogs técnicos dedicados ao Nemotron 3.5 Lightning e ao NeMo Switchyard.
Fonte: NVIDIA
