NVIDIA Nemotron 3.5 Lightning e NeMo Switchyard offrono un'IA agentica più veloce, intelligente ed efficiente

@nvidia
INGLESE11 ago 2026
118K
897
137
95
108

TL;DR

NVIDIA ha lanciato Nemotron 3.5 Lightning, un modello MoE da 30B di parametri, insieme a NeMo Switchyard, una libreria open source per il routing intelligente dei modelli negli agenti IA.

Il nuovo modello open leggero e la libreria di routing offrono un maggiore controllo su AI, dati e workflow su dispositivi edge, PC, workstation, data center e cloud.

Fonte: Blog NVIDIA

Di Kari Briski, Vicepresidente di Generative AI, NVIDIA

Mentre l'AI passa dai chatbot agli agenti autonomi, i modelli open soddisfano la domanda del mercato di un controllo completo su dove viene eseguita l'AI, su come viene distribuita e su come evolve.

Oggi NVIDIA amplia la famiglia di modelli Nemotron 3 con Nemotron 3.5 Lightning, il modello più efficiente della sua categoria per carichi di lavoro agentici AI di lunga durata. Questa release segue Nemotron 3 Nano e riflette l'impegno di NVIDIA nel migliorare costantemente i modelli open per garantire maggiore accuratezza e velocità.

Progettato per attività specializzate all'interno di sistemi multi-agente più ampi, Nemotron 3.5 Lightning, un modello mixture-of-experts da 30 miliardi di parametri, aiuta a creare applicazioni agentiche più intelligenti ed efficienti.

Inoltre, NVIDIA rilascia NeMo Switchyard, una libreria open source per il routing intelligente all'interno dei più diffusi strumenti per agenti. Le aziende possono usarla per creare un router in base alle proprie esigenze specifiche. Una volta distribuito, NeMo Switchyard può instradare in modo intelligente ogni richiesta al modello più capace e adatto per l'attività, senza richiedere agli sviluppatori di riscrivere le proprie applicazioni.

Insieme, Nemotron 3.5 Lightning e NeMo Switchyard offrono un maggiore controllo su come viene distribuita l'AI, su dove viene eseguita e con quale efficienza opera — su PC, workstation, data center e cloud.

NVIDIA - inline image

Figura 1. Nemotron 3.5 Lightning offre intelligenza di livello frontier in un piccolo modello open personalizzabile, progettato per workflow agentici ad alto volume.

Gli agenti always-on richiedono un sistema di modelli

I moderni sistemi agentici — agenti always-on — operano sempre più spesso come sistemi di modelli, ovvero ensemble di modelli, con modelli diversi specializzati per attività diverse.

I modelli open NVIDIA Nemotron sono progettati per questa architettura. Un modello di ragionamento frontier come Nemotron 3 Ultra o GPT-5.6 può pianificare e orchestrare un workflow, mentre modelli specializzati più piccoli come Nemotron 3.5 Lightning possono eseguire attività mirate come la revisione del codice, l'uso di strumenti, il monitoraggio degli alert di sicurezza e la risposta alle domande di fatturazione.

Alimentare le attività specializzate ad alto volume con Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning è un modello open completamente personalizzabile, progettato per attività ad alto volume che alimentano agenti always-on. È stato sviluppato con il contributo della Nemotron Coalition, i cui membri hanno fornito metodologie di valutazione, software di inferenza e dataset per far progredire il modello.

Il modello offre una velocità di output fino a 4 volte superiore, con un completamento delle attività agentiche più rapido del 30% rispetto ad altri modelli della stessa categoria. E poiché è open e personalizzabile, Nemotron 3.5 Lightning può essere facilmente post-addestrato con NVIDIA NeMo sui dati di dominio, sugli strumenti e sui workflow di un'organizzazione per migliorare l'accuratezza delle attività specializzate.

NVIDIA - inline image

Figura 2. I benchmark PinchBench dimostrano che Nemotron 3.5 Lightning garantisce un completamento più rapido delle attività agentiche con un'accuratezza di livello frontier rispetto ad altri modelli della stessa categoria.

I leader dell'AI di vari settori stanno personalizzando Nemotron 3.5 Lightning per i propri carichi di lavoro, tra cui @CrowdStrike per la cybersecurity, @Harvey con @TrajectoryLabs per i servizi legali e @CodeRabbitAI con @Baseten per la revisione del codice, contribuendo a migliorare l'accuratezza delle attività agentiche specifiche del dominio. Inoltre, @LilaSciences sta contribuendo a migliorare le capacità di ragionamento per le attività agentiche nelle scienze fisiche e della vita, e @FastinoAI ha personalizzato il modello, ottenendo accuratezze leader per i carichi di lavoro nello sviluppo software, nella finanza e nella sanità.

NVIDIA - inline image

Figura 3. Le aziende hanno personalizzato Nemotron 3.5 Lightning per raggiungere un'accuratezza leader nelle attività specializzate dei propri workflow agentici.

Nemotron 3.5 Lightning offre inoltre alle organizzazioni il controllo su privacy e distribuzione. Può essere eseguito su sistemi AI locali — inclusi PC NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station e NVIDIA Jetson — per aiutare gli utenti a massimizzare gli investimenti infrastrutturali esistenti, oppure per scalare su dispositivi AI edge, workstation NVIDIA RTX PRO, data center e ambienti cloud per casi d'uso aziendali. Nemotron 3.5 Lightning può inoltre essere eseguito localmente o on-premises per attività specializzate ad alto volume che richiedono risposte rapide.

Inoltre, come per ogni lancio di Nemotron, NVIDIA pubblica i dati e le tecniche di addestramento, consentendo tracciabilità, audit e addestramento di altri modelli. Accanto a Nemotron 3.5 Lightning, NVIDIA rilascia due nuovi dataset open di reinforcement learning utilizzati per il suo post-addestramento: Nemotron-RL-Agentic-Terminal-Pivot, un ambiente agentico incentrato sul codice, e Nemotron-RL-Lighting-Training-Blend, un blend di dati RL più ampio costruito sui dati rilasciati in precedenza con Nemotron Ultra.

App AI più efficienti con il model routing

Alcuni modelli sono migliori per la codifica, altri per il ragionamento, altri per attività leggere e altri ancora sono ottimizzati per l'esecuzione locale, garantendo maggiore privacy ed efficienza. Se i clienti fanno affidamento su un unico modello predefinito, rischiano di spendere troppo o di perdere in qualità; se gestiscono il routing manualmente, diventa un lavoro di integrazione che può rallentare la distribuzione.

NVIDIA NeMo Switchyard è una libreria open source di model routing per agenti AI. La tecnologia instrada automaticamente i prompt al modello più capace ed efficiente per ogni fase di un workflow agentico, in base alle esigenze specifiche. Gli sviluppatori di applicazioni agentiche possono ottimizzare o modificare il router con diversi algoritmi di routing per allinearli alle proprie priorità, come requisiti di qualità, latenza e costo. In un sistema di modelli, le aziende possono creare potenti agenti AI con tokenomics migliorate.

I benchmark interni mostrano che NeMo Switchyard mantiene un'accuratezza di livello frontier riducendo il costo di completamento delle attività a circa un terzo rispetto al solo Opus 4.8.

NVIDIA - inline image

Figura 4. I benchmark interni di NVIDIA mostrano che NeMo Switchyard mantiene un'accuratezza di livello frontier riducendo il costo di completamento delle attività a circa un terzo rispetto al solo Opus 4.8.

NVIDIA collabora con partner dell'intero ecosistema AI per portare il model routing intelligente negli strumenti e nelle piattaforme che gli sviluppatori già utilizzano.

  • @Boomi: Ha valutato Switchyard su cinque capacità di routing, raggiungendo il 100% di accuratezza del domain routing, inviando il 59% del traffico a un modello fine-tuned 5 volte più veloce e riducendo la latenza dei turni successivi del 21%.
  • @Cadence: Ha migliorato l'efficienza del 9,9% utilizzando il ChipStack AI Super Agent per un caso d'uso di verifica formale.
  • @Classmethod: Sta eseguendo carichi di lavoro opencode e Fireworks utilizzando NeMo Switchyard internamente, con test iniziali che mostrano una riduzione dei costi del 27% mantenendo la qualità.
  • @Cognition: Ha integrato il router a stadi di NVIDIA NeMo Switchyard in Devin Desktop per uso interno NVIDIA, raggiungendo prestazioni near-frontier su FrontierCode Main con una riduzione del costo medio del 28% rispetto all'instradamento di tutte le richieste verso un unico modello frontier sottostante.
  • @Kong: Offre il routing con NeMo Switchyard nativamente tramite Kong AI Gateway.
  • @LangChain: Con NeMo Switchyard, ha ottenuto una riduzione dei costi del 74% in 145 attività Deep Agents multi-turn, instradando solo il 7% delle chiamate a un modello frontier, con un compromesso di accuratezza del 6%.
  • @LiteLLM: Sta aggiungendo NeMo Switchyard come plug-in nel proprio proxy layer, così gli sviluppatori possono usufruire di questi vantaggi senza modificare il proprio stack esistente.
  • @NousResearch: Ha integrato NeMo Switchyard in Hermes per offrire agli sviluppatori un sistema di routing facile da configurare per migliorare l'efficienza degli agenti.
  • @TryRamp: Ha utilizzato NeMo Switchyard per eguagliare le prestazioni di un modello frontier, riducendo i costi del 58% e i tempi di esecuzione del 33% in Ramp SWE-Bench.
  • @Siemens: Sta eseguendo benchmark per migliorare l'efficienza del proprio Fuse EDA AI Agent.

Nemotron 3.5 Lightning è disponibile su Hugging Face, ModelScope, OpenRouter e build.nvidia.com come microservizio NVIDIA NIM, oltre che attraverso un ampio ecosistema di NVIDIA Cloud Partners, piattaforme di post-addestramento, piattaforme di inferenza e provider di servizi cloud. NeMo Switchyard è disponibile su GitHub e arriverà presto sulle piattaforme partner.

Rielabora in YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali