NVIDIA Nemotron 3.5 Lightning et NeMo Switchyard offrent une IA agentique plus rapide, plus intelligente et plus efficace

@nvidia
ANGLAIS11 août 2026
118K
897
137
95
108

TL;DR

NVIDIA a lancé Nemotron 3.5 Lightning, un modèle MoE de 30 milliards de paramètres, ainsi que NeMo Switchyard, une bibliothèque open-source dédiée au routage intelligent des modèles au sein des agents IA.

Le nouveau modèle ouvert léger et la bibliothèque de routage offrent un contrôle accru sur l'IA, les données et les workflows, sur les appareils en périphérie, les PC, les postes de travail, les centres de données et le cloud.

Source : Blog NVIDIA

Par Kari Briski, vice-présidente de l'IA générative chez NVIDIA

Alors que l'IA passe des chatbots aux agents autonomes, les modèles ouverts répondent à la demande du marché pour un contrôle total sur l'endroit où l'IA s'exécute et sur la manière dont elle est déployée et évolue.

Aujourd'hui, NVIDIA étend sa famille de modèles Nemotron 3 avec Nemotron 3.5 Lightning, le modèle le plus efficace de sa catégorie pour les charges de travail d'IA agentique de longue durée. Cette sortie fait suite à Nemotron 3 Nano et reflète l'engagement de NVIDIA à améliorer en continu les modèles ouverts pour une précision et une vitesse accrues.

Conçu pour des tâches spécialisées au sein de systèmes multi-agents plus vastes, Nemotron 3.5 Lightning, un modèle mixture-of-experts de 30 milliards de paramètres, contribue à créer des applications agentiques plus intelligentes et plus efficaces.

NVIDIA lance également NeMo Switchyard, une bibliothèque open source pour le routage intelligent au sein des outils d'agents les plus populaires. Les entreprises peuvent l'utiliser pour créer un routeur adapté à leurs besoins spécifiques. Une fois déployé, NeMo Switchyard achemine intelligemment chaque requête vers le modèle le plus performant et le plus adapté à la tâche, sans obliger les développeurs à réécrire leurs applications.

Ensemble, Nemotron 3.5 Lightning et NeMo Switchyard offrent un meilleur contrôle sur la façon dont l'IA est déployée, où elle s'exécute et avec quelle efficacité elle fonctionne — sur les PC, les postes de travail, les centres de données et le cloud.

NVIDIA - inline image

Figure 1. Nemotron 3.5 Lightning offre une intelligence de pointe dans un petit modèle ouvert personnalisable, conçu pour les workflows agentiques à volume élevé.

Les agents toujours actifs ont besoin d'un système de modèles

Les systèmes agentiques modernes — agents toujours actifs — fonctionnent de plus en plus comme des systèmes de modèles, ou ensembles de modèles, avec différents modèles spécialisés dans différentes tâches.

Les modèles ouverts NVIDIA Nemotron sont conçus pour cette architecture. Un modèle de raisonnement de pointe comme Nemotron 3 Ultra ou GPT-5.6 peut planifier et orchestrer un workflow, tandis que des modèles spécialisés plus petits comme Nemotron 3.5 Lightning peuvent effectuer des tâches ciblées telles que la revue de code, l'utilisation d'outils, la surveillance des alertes de sécurité et la réponse aux questions de facturation.

Propulser les tâches spécialisées à volume élevé avec Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning est un modèle ouvert entièrement personnalisable, conçu pour les tâches à volume élevé qui propulsent les agents toujours actifs. Il a été développé avec la contribution de la Nemotron Coalition, dont les membres ont fourni des méthodologies d'évaluation, des logiciels d'inférence et des jeux de données pour faire progresser le modèle.

Le modèle offre une vitesse de génération jusqu'à 4 fois supérieure, ce qui se traduit par une exécution des tâches agentiques 30 % plus rapide par rapport aux autres modèles de sa catégorie. Et comme il est ouvert et personnalisable, Nemotron 3.5 Lightning peut être facilement post-entraîné avec NVIDIA NeMo sur les données, les outils et les workflows propres à une organisation, afin d'améliorer la précision des tâches spécialisées.

NVIDIA - inline image

Figure 2. Les benchmarks PinchBench démontrent que Nemotron 3.5 Lightning assure une exécution plus rapide des tâches agentiques avec une précision de pointe par rapport aux autres modèles de sa catégorie.

Les leaders de l'IA issus de tous les secteurs personnalisent Nemotron 3.5 Lightning pour leurs charges de travail, notamment @CrowdStrike pour la cybersécurité, @Harvey avec @TrajectoryLabs pour les services juridiques et @CodeRabbitAI avec @Baseten pour la revue de code, contribuant ainsi à améliorer la précision des tâches agentiques spécifiques à un domaine. De plus, @LilaSciences contribue à améliorer les capacités de raisonnement pour les tâches agentiques dans les sciences physiques et de la vie, et @FastinoAI a personnalisé le modèle et obtient des précisions de premier plan pour les charges de travail en développement logiciel, en finance et en santé.

NVIDIA - inline image

Figure 3. Les entreprises ont personnalisé Nemotron 3.5 Lightning pour atteindre une précision de premier plan pour leurs tâches spécialisées dans leurs workflows agentiques.

Nemotron 3.5 Lightning offre également aux organisations un contrôle sur la confidentialité et le déploiement. Il peut s'exécuter sur des systèmes d'IA locaux — notamment les PC NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station et NVIDIA Jetson — pour aider les utilisateurs à maximiser leurs investissements existants en infrastructure, ou passer à l'échelle sur les appareils d'IA en périphérie, les postes de travail NVIDIA RTX PRO, les centres de données et les environnements cloud pour les cas d'usage professionnels. Nemotron 3.5 Lightning peut également s'exécuter en local ou sur site pour les tâches spécialisées à volume élevé qui nécessitent des réponses rapides.

Comme pour chaque lancement de Nemotron, NVIDIA publie également les données et les techniques d'entraînement, ce qui permet la traçabilité, l'audit et l'entraînement d'autres modèles. Parallèlement à Nemotron 3.5 Lightning, NVIDIA publie deux nouveaux jeux de données ouverts d'apprentissage par renforcement utilisés pour son post-entraînement : Nemotron-RL-Agentic-Terminal-Pivot, un environnement de code agentique, et Nemotron-RL-Lighting-Training-Blend, un ensemble de données RL plus large construit sur des données précédemment publiées avec Nemotron Ultra.

Des applications d'IA plus efficaces grâce au routage de modèles

Certains modèles sont meilleurs pour le codage, d'autres pour le raisonnement, certains pour les tâches légères, et d'autres encore sont optimisés pour s'exécuter en local afin de garantir une meilleure confidentialité et une plus grande efficacité. Si les clients s'appuient sur un seul modèle par défaut, ils risquent soit de dépenser trop, soit de perdre en qualité ; s'ils gèrent le routage manuellement, cela devient un travail d'intégration qui peut ralentir un déploiement.

NVIDIA NeMo Switchyard est une bibliothèque open source de routage de modèles pour les agents d'IA. Cette technologie achemine automatiquement les prompts vers le modèle le plus performant et le plus efficace pour chaque étape d'un workflow d'agent, en fonction des besoins spécifiques. Les développeurs d'applications d'agents peuvent ajuster ou modifier le routeur avec différents algorithmes de routage pour correspondre à leurs priorités, telles que les exigences de qualité, de latence et de coût. Dans un système de modèles, les entreprises peuvent créer des agents d'IA puissants avec une tokenomics améliorée.

Les benchmarks internes montrent que NeMo Switchyard maintient une précision de pointe tout en réduisant le coût d'exécution des tâches à près d'un tiers de celui d'Opus 4.8 seul.

NVIDIA - inline image

Figure 4. Les benchmarks internes de NVIDIA montrent que NeMo Switchyard maintient une précision de pointe tout en réduisant le coût d'exécution des tâches à près d'un tiers de celui d'Opus 4.8 seul.

NVIDIA travaille avec des partenaires de tout l'écosystème de l'IA pour intégrer le routage intelligent de modèles dans les outils et les plateformes que les développeurs utilisent déjà.

  • @Boomi: A évalué Switchyard sur cinq capacités de routage, atteignant une précision de routage par domaine de 100 %, envoyant 59 % du trafic vers un modèle affiné 5 fois plus rapide et réduisant la latence des tours suivants de 21 %.
  • @Cadence: A amélioré l'efficacité de 9,9 % en utilisant le ChipStack AI Super Agent pour un cas d'usage de vérification formelle.
  • @Classmethod: Exécute des charges de travail opencode et Fireworks avec NeMo Switchyard en interne, les premiers tests montrant une réduction des coûts de 27 % tout en maintenant la qualité.
  • @Cognition: A intégré le routeur par étapes NeMo Switchyard de NVIDIA dans Devin Desktop pour un usage interne à NVIDIA, atteignant des performances proches de celles des modèles de pointe sur FrontierCode Main tout en réduisant le coût moyen de 28 % par rapport à un routage de toutes les requêtes vers un seul modèle de pointe sous-jacent.
  • @Kong: Propose un routage avec NeMo Switchyard en natif via Kong AI Gateway.
  • @LangChain: Avec NeMo Switchyard, a obtenu une réduction des coûts de 74 % sur 145 tâches Deep Agents multi-tours en routant seulement 7 % des appels vers un modèle de pointe, pour un compromis de précision de 6 %.
  • @LiteLLM: Ajoute NeMo Switchyard sous forme de plug-in dans sa couche proxy afin que les développeurs puissent bénéficier de ces avantages sans modifier leur pile technologique existante.
  • @NousResearch: A intégré NeMo Switchyard dans Hermes pour offrir aux développeurs un système de routage facile à configurer afin d'améliorer l'efficacité des agents.
  • @TryRamp: A utilisé NeMo Switchyard pour égaler les performances d'un modèle de pointe tout en réduisant les coûts de 58 % et le temps d'exécution de 33 % dans Ramp SWE-Bench.
  • @Siemens: Effectue des benchmarks pour améliorer l'efficacité de son Fuse EDA AI Agent.

Nemotron 3.5 Lightning est disponible sur Hugging Face, ModelScope, OpenRouter et build.nvidia.com sous forme de microservice NVIDIA NIM, ainsi que via un large écosystème de NVIDIA Cloud Partners, de plateformes de post-entraînement, de plateformes d'inférence et de fournisseurs de services cloud. NeMo Switchyard est disponible sur GitHub et arrivera bientôt sur les plateformes partenaires.

Remixer dans YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux