Gli agenti di intelligenza artificiale stanno passando dai semplici chatbot a sistemi autonomi che devono eseguire task complessi in modo continuo, su infrastrutture eterogenee e con vincoli di costo precisi. NVIDIA risponde a questa fase con un nuovo modello aperto e una libreria di routing pensata per dare ai team più controllo su dove e come girano i carichi di lavoro degli agenti AI.

Il modello
Nemotron 3.5 Lightning è un modello mixture-of-experts (MoE) con 30 miliardi di parametri totali e 3 miliardi attivi, progettato per task specializzati ad alto volume all'interno di sistemi multi-agente. Offre fino a 4 volte la velocità di output rispetto a modelli simili e completa i task agentic il 30% più velocemente. Il modello supporta un contesto di 1 milione di token ed è disponibile in pesi BF16 e NVFP4 per la quantizzazione. È rilasciato sotto licenza OpenMDW-1.1, aperto all'uso commerciale senza restrizioni materiali.

Il routing intelligente
NeMo Switchyard è una libreria open source scritta in Rust che funge da proxy per il traffico LLM, indirizzando le richieste al modello più adatto in base a qualità, latenza e costo. Supporta routing senza training, escalation automatica verso modelli più potenti quando necessario e traduzione tra API OpenAI e Anthropic. La libreria è in versione pre-alpha (v0.2.0) e non è ancora indicata per uso in produzione.
Partner e risultati
Boomi ha raggiunto il 100% di accuratezza nel domain-routing, inviando il 59% del traffico a un modello 5 volte più veloce. Classmethod ha ridotto i costi del 27%, Cognition del 28%, LangChain del 74% su 145 task multi-turno e Ramp ha tagliato costi del 58% e runtime del 33%.

Dove trovarlo
Nemotron 3.5 Lightning è disponibile su Hugging Face, ModelScope, OpenRouter e build.nvidia.com come NVIDIA NIM microservice, oltre che tramite provider di inference come DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius e Crusoe. NeMo Switchyard è su GitHub e arriverà presto su piattaforme partner.

Informazioni tecniche
- Parametri totali: 31,6 miliardi
- Parametri attivi: 3,6 miliardi
- Contesto: 1 milione di token
- Licenza: OpenMDW-1.1 (uso commerciale libero)
- Data cutoff pre-training: settembre 2025
- Data cutoff post-training: maggio 2026
Domande frequenti
- Cos'è Nemotron 3.5 Lightning? Un modello aperto MoE da 30B parametri con 3B attivi, ottimizzato per task specializzati in sistemi di agenti AI sempre attivi.
- A cosa serve NeMo Switchyard? A indirizzare automaticamente ogni richiesta al modello più capace ed efficiente, riducendo costi e latenza senza riscrivere le applicazioni.
- È gratuito? Sì, entrambi sono open source e liberi per uso commerciale.
- Posso usarlo in produzione? Nemotron 3.5 Lightning sì; NeMo Switchyard è ancora pre-alpha e non indicato per produzione.
Glossario
- Mixture-of-Experts (MoE): architettura in cui solo una parte dei parametri viene attivata per ogni input, migliorando efficienza.
- Agentic AI: sistemi di agenti autonomi che eseguono task complessi senza intervento umano continuo.
- Inferenza: fase in cui il modello esegue le richieste, genera output e completa i task su infrastrutture locali o cloud.
- Routing: selezione automatica del modello più adatto per ogni richiesta in base a qualità, latenza e costo.
- Token: unità di testo elaborata dal modello (parole o parti di parole), usata per misurare contesto e throughput.
- BF16: formato numerico a 16 bit per pesi del modello, che riduce memoria mantenendo buona precisione.
- NVFP4: formato di quantizzazione NVIDIA a 4 bit per ridurre ulterioremente memoria e latenza con degrado minimo.
- Context window: quantità massima di token che il modello può considerare in una singola richiesta (nel caso di Nemotron 3.5 Lightning, fino a 1 milione di token).
NVIDIA Blog, 11 agosto 2026
Hugging Face, 11 agosto 2026
GitHub, 10 agosto 2026
CNBC, 11 agosto 2026