Actualité · Modèles IA
NVIDIA Nemotron 3.5 Lightning et NeMo Switchyard : comment un system of models divise le coût de tes agents par 4
24 août 2026 · 5 min de lecture

Tu fais tourner un agent IA qui traite 200 tickets support par jour. Chaque ticket passe par 6 appels de modèle : lire, classifier, chercher, rédiger, vérifier, archiver. Sur ces 6 appels, combien ont vraiment besoin d'un modèle frontier ? LangChain a mesuré la réponse : 7%. Les 93% restants, un petit modèle ouvert les gère tout aussi bien.
C'est le constat qui a poussé NVIDIA à sortir Nemotron 3.5 Lightning et NeMo Switchyard le 11 août 2026. Pas un modèle plus intelligent. Deux outils pour construire ce que NVIDIA appelle un "system of models" : un frontier qui orchestre et décide, un petit modèle qui fait le volume, et un routeur qui dispatch.
Nemotron 3.5 Lightning : 30B dont 3B actifs, pour le volume
Nemotron 3.5 Lightning est un modèle mixture-of-experts (MoE) de 31,6 milliards de paramètres totaux, dont 3,6 milliards actifs par token. Architecture hybride Mamba-2 + MoE + Attention, fenêtre de contexte d'un million de tokens, modèle de raisonnement textuel. Licence OpenMDW-1.1, ouverte pour un usage commercial.
Sur l'Intelligence Index d'Artificial Analysis, il score 24. Pour comparer : gpt-oss-120b d'OpenAI score 24 aussi, avec 4 fois plus de paramètres. Nemotron 3 Super, le modèle de NVIDIA qui est ~4 fois plus gros, score 26. Les modèles frontier comme GPT-5.6 Terra et Muse Spark 1.2 sont à 57.
Le modèle n'est pas fait pour gagner des benchmarks. Il est fait pour aller vite. Artificial Analysis a mesuré 670 tokens par seconde en sortie sur un endpoint DeepInfra avec les poids NVFP4 (quantification légère, quasiment sans perte : 24 en BF16, 24 en NVFP4). C'est 5 à 10 fois plus rapide que les modèles de sa catégorie servis sur le marché.
Les gains agentiques sont là aussi. Sur GDPval-AA v2 (évaluation agentique), il passe devant Nemotron 3 Super et gpt-oss-120b. Sur Terminal-Bench v2.1, il passe de 7% (Nemotron 3 Nano) à 24%, soit x3,4 en une génération.
NeMo Switchyard : le routeur open source qui dispatch
Le deuxième outil, NeMo Switchyard, est une bibliothèque open source qui se branche entre ton agent et tes modèles. Tu configures les modèles disponibles, tu choisis ta stratégie de routing, et Switchyard envoie chaque appel au bon modèle.
Deux approches de routing sont disponibles en production :
-
Classifieur LLM : un petit modèle juge lit chaque tour et décide quel modèle doit traiter l'appel. Trois modes : "capability" (un modèle par appel selon la tâche), "escalation" (on commence par le petit modèle, on monte au frontier après deux échecs consécutifs), et "custom" (tu définis tes règles). Coût supplémentaire : un appel au juge par tour, mais l'escalation limite ce coût en arrêtant le juge une fois la tâche promue.
-
Stage router heuristique : route par étape de workflow, sans appel de modèle supplémentaire. Lit les patterns d'erreur, de raisonnement et le compte de tokens. Latence proche de zéro. Pas benchmarké par LangChain.
Une troisième approche, le prefill-activation MLP, est en recherche. Elle route sur les activations internes du modèle au moment du prefill.
NVIDIA publie les résultats internes : Switchyard maintient une accuracy au niveau frontier tout en réduisant le coût de complétion de tâche à environ un tiers de ce que coûte Opus 4.8 seul.
Ce que LangChain a mesuré : 7% au frontier, 93% au petit
LangChain a fait tourner Switchyard sur Deep Agents, sa suite d'évaluation de 145 tâches agentiques multi-étapes (support client, investigation d'incident, automatisation de workflow). Chaque tâche fait en moyenne 6,3 appels de modèle.
Trois configurations testées :
| Configuration | Accuracy | Coût par run | Coût par tâche |
|---|---|---|---|
| Opus 4.8 seul | 86,0% | 11,45$ | 0,092$ |
| Opus + Nemotron 3.5 Lightning (routé) | 80,0% | 3,00$ | 0,026$ |
| Nemotron 3.5 Lightning seul | 77,7% | 0,72$ | 0,006$ |
La conclusion est claire : le routeur a envoyé 93% des appels au petit modèle et 7% au frontier. Le petit modèle a consommé 10,4% du budget, le frontier 68,4%, le juge 21,2%. Le coût total baisse de 74%, l'accuracy perd 6 points.
Ramp a mesuré des gains similaires avec Switchyard sur SWE-Bench : 58% de coût en moins et 33% de runtime en moins, en matchant la performance du modèle frontier seul.
La mise en garde de LangChain : l'écart de 6 points d'accuracy est réel et hors bruit (les runs varient de 2,7 points). Le routing n'est pas gratuit en qualité. Et le coût du juge, qui tourne à chaque tour jusqu'à l'escalade, est la deuxième ligne de dépense. Si tu veux optimiser, le choix du juge compte autant que le choix du frontier.
Les partenaires qui déploient déjà
NVIDIA ne publie pas que des outils. Elle montre qui les utilise en production :
- CrowdStrike : cybersécurité, customisation de Lightning pour la détection de menaces.
- Harvey (avec Trajectory) : services juridiques, Lightning adapté pour les tâches légales.
- CodeRabbit (avec Baseten) : code review, Lightning réentraîné pour router les reviews.
- Cognition : Switchyard intégré dans Devin Desktop, 28% de coût en moins vs frontier seul sur FrontierCode Main.
- LangChain : 74% de coût en moins sur Deep Agents.
- Ramp : 58% de coût en moins, 33% de runtime en moins sur SWE-Bench.
- Boomi : 100% d'accuracy de routing domain, 59% du trafic envoyé vers un modèle 5x plus rapide, latence réduite de 21%.
- Kong : routing natif via Kong AI Gateway.
- LiteLLM : intégration en plug-in dans le proxy layer.
Le pattern est cohérent : le petit modèle fait le volume, le frontier gère les cas difficiles, le routeur décide. Chaque partenaire reporte entre 28% et 74% de coût en moins, avec une perte d'accuracy mesurée et acceptée.
Un exemple chez Maisons&Mobilia
Sophie, PM chez Maisons&Mobilia (M&M, enseigne de meubles fictive), fait tourner un agent IA qui analyse les retours clients de l'e-commerce. L'agent lit chaque retour, classifie le motif (défaut produit, retard livraison, taille incorrecte), propose une réponse, et archive. Volume : 500 retours par semaine, 6 appels de modèle par retour, soit 3 000 appels par semaine.
Avec Claude Opus 4.8 seul (15$/M input, 75$/M output), le coût mensuel tourne autour de 120 euros. L'accuracy est bonne, mais Sophie se demande si les 80% de retours standards ont vraiment besoin du frontier.
Elle met en place Switchyard entre son agent et ses modèles. Configuration : Nemotron 3.5 Lightning pour le volume, Claude Opus 4.8 pour les cas complexes, mode escalation (deux échecs consécutifs avant de monter au frontier).
Résultat sur une semaine : 93% des appels vont à Lightning, 7% à Opus. Le coût tombe à 31 euros par mois. L'accuracy sur les retours standards (défaut, retard, taille) est identique. Sur les cas limites (un client qui mélange trois motifs, un retour qui touche à la régulation), Opus reste meilleur, et le routeur le détecte : après deux échecs de Lightning, la tâche monte au frontier.
Les 6 points d'accuracy perdus concernent les cas les plus complexes, ceux que Sophie revérifiait déjà à la main. Le gain : 89% de coût en moins, et un agent qui tourne 4 fois plus vite sur le volume.
La limite : le juge tourne à chaque tour de Lightning, ce qui ajoute un appel de modèle supplémentaire. Sophie choisit un petit modèle gratuit (gpt-oss-20b) comme juge, ce qui limite le surcoût. Et le stage router heuristique, qui ne fait aucun appel supplémentaire, est une option pour les workflows où les étapes sont prévisibles.
Ce que ça change si tu apprends l'IA
L'annonce de NVIDIA illustre un concept qui devient central en 2026 : un agent IA n'est pas un seul modèle, c'est un système. Le "system of models" n'est pas un buzz marketing. C'est une architecture où chaque modèle a un rôle, et où le coût dépend de la répartition, pas du choix d'un seul modèle.
Pour l'audience de saisir.ai, trois notions concrètes ressortent :
- Tool use : Switchyard est un outil que l'agent appelle pour décider quel modèle utiliser. C'est du tool use appliqué au routing, pas à l'exécution de tâches.
- Orchestration : le system of models est un cas d'orchestration. Le frontier planifie, le petit modèle exécute, le routeur dispatch. Un agent n'est pas un modèle plus intelligent, c'est un système qui coordonne des étapes et des rôles.
- Moindre privilège : envoyer une tâche simple à un modèle frontier, c'est donner trop de pouvoir (et trop de coût) à une étape qui n'en a pas besoin. Le routing applique le moindre privilège au choix de modèle.
La compétence pratique, c'est de savoir quand un petit modèle suffit et quand il faut le frontier. Pas choisir le "meilleur modèle" (ça n'existe pas hors contexte), mais le bon modèle pour chaque étape.
Aller plus loin
Pour comprendre comment un agent IA utilise des outils et enchaîne des étapes, notre article sur comment fonctionne un agent IA pose les bases du tool use et de l'orchestration. Pour voir les garde-fous concrets à mettre en place quand un agent agit dans tes outils, le guide sur les garde-fous des agents IA détaille le moindre privilège et le human in the loop. Et pour t'entraîner à ces notions en 5 minutes par jour, l'app saisir.ai propose des modules interactifs sur les agents, le tool use et les familles de modèles, en français, sans coder.
Sources
- NVIDIA, "NVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AI", 11 août 2026
- NVIDIA Developer, "NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents", 11 août 2026
- Artificial Analysis, "NVIDIA launches Nemotron 3.5 Lightning", 11 août 2026
- LangChain, "How many of your agent's calls actually need a frontier model?", août 2026
- NeMo Switchyard, dépôt GitHub
- NVIDIA Nemotron 3.5 Lightning, poids sur Hugging Face
Questions fréquentes
- C'est quoi Nemotron 3.5 Lightning ?
- Nemotron 3.5 Lightning est un modèle d'IA ouvert de 30 milliards de paramètres (3 milliards actifs par token) lancé par NVIDIA le 11 août 2026. Il est conçu pour les tâches de volume dans les agents IA : code review, tool use, monitoring. Il atteint 24 sur l'Intelligence Index d'Artificial Analysis, au niveau de gpt-oss-120b, avec une vitesse de sortie de 670 tokens par seconde.
- Qu'est-ce que NeMo Switchyard ?
- NeMo Switchyard est une bibliothèque open source de NVIDIA qui route automatiquement chaque appel d'un agent IA vers le modèle le plus adapté. Tu configures les modèles disponibles et tes priorités (qualité, latence, coût), et le routeur envoie les tâches simples au petit modèle et les tâches complexes au frontier. C'est un proxy que tu branches entre ton agent et tes modèles.
- Combien on économise avec un system of models ?
- LangChain a mesuré 74% de réduction de coût en routant les appels entre Nemotron 3.5 Lightning et Claude Opus 4.8, sur 145 tâches agentiques multi-étapes. 93% des appels sont allés au petit modèle, 7% au frontier. La perte d'accuracy était de 6 points (86% à 80%). Ramp a mesuré 58% de coût en moins et 33% de runtime en moins sur SWE-Bench.
- Nemotron 3.5 Lightning est-il gratuit ?
- Les poids du modèle sont disponibles gratuitement sous licence OpenMDW-1.1, ouverte pour un usage commercial. L'inférence serverless est disponible chez des providers comme DeepInfra, Fireworks, OpenRouter (gratuit) et build.nvidia.com. Le coût dépend du provider et du volume.
- Quelle est la différence entre Nemotron 3.5 Lightning et un modèle frontier ?
- Nemotron 3.5 Lightning score 24 sur l'Intelligence Index, contre 57 pour GPT-5.6 Terra et 57 pour Muse Spark 1.2. Il est moins intelligent sur les tâches longues et complexes. Mais il est 4 fois plus rapide en sortie et coûte 87 fois moins cher par appel qu'un modèle frontier. Il est fait pour le volume, pas pour les décisions difficiles.