Actualité · Agents IA

Multi-Agent v2 : OpenAI laisse ses IA s'organiser entre elles, et le coût s'effondre

17 août 2026 · 5 min de lecture

Illustration aquarelle d'un petit robot astronaute violet orchestrant trois robots assistants plus petits, avec un prix baissant, un éclair et une flèche de délégation, symbolisant la délégation multi-modèle et la réduction de coût

Tu n'as plus besoin de choisir quel modèle IA utiliser. Le 16 août 2026, OpenAI a lancé Multi-Agent v2 : GPT-5.6 Sol, son modèle le plus puissant, peut maintenant déléguer des sous-tâches à Luna, un modèle 25 fois moins cher. L'agent orchestrateur répartit le travail tout seul, et le coût d'un agent complet s'effondre.

Ce qui a changé le 16 août

OpenAI a trois modèles dans la famille GPT-5.6 : Sol (frontier, raisonnement lourd), Terra (équilibré) et Luna (rapide, économique). Jusqu'à la semaine dernière, Sol et Terra tournaient sur Multi-Agent v2, mais Luna était restée bloquée en v1. Quand Sol tentait de lui déléguer une tâche, le système renvoyait une erreur "unknown model". Les développeurs ouvraient des issues sur GitHub. Un post sur le forum OpenAI s'intitulait "Give Us Back Luna".

La mise à jour du 16 août corrige ça. Sol peut assigner des sous-tâches à n'importe quel modèle de la famille, Luna incluse. Chaque sous-agent garde son propre niveau de raisonnement (low, medium, high, extra high), configurable indépendamment. Greg Brockman, président d'OpenAI, l'a résumé ainsi : on va vers la fin de la sélection manuelle de modèle.

La famille complète disponible pour la délégation : Sol (agentique complexe), Terra (travail quotidien), Luna (volume et vitesse), Daybreak (cybersécurité), GPT-5.5 (tâches générales).

Pourquoi la délégation cross-model change l'économie

Un agent IA qui travaille sur une tâche complexe enchaîne des dizaines d'étapes. Lire un fichier, extraire des données, rédiger, vérifier, formater. Toutes ces étapes n'ont pas besoin du modèle le plus intelligent. OpenAI cite un exemple sur BrowseComp, un benchmark de recherche : GPT-5.6 Luna en raisonnement extra-high obtient le même score que GPT-5.5 en raisonnement high, mais pour 1,33 $ au lieu de 33,27 $. Vingt-cinq fois moins cher.

Le builder's guide publié par OpenAI le 13 août donne la logique : pour une tâche agentique typique, 20% des étapes nécessitent le modèle frontier. Les 80% restants peuvent être assignées à des modèles moins chers. Si tu utilises Sol pour tout, tu paies le prix frontier pour du travail que Luna pourrait faire.

OpenAI a aussi publié trois leviers d'optimisation dans son API Responses :

  • Retained reasoning : le modèle persiste son raisonnement entre les tours, sans recomencer à zéro. Sur ARC-AGI-3, ça fait passer le score de 13,3% à 38,3%, avec 6 fois moins de tokens en sortie.
  • Programmatic tool calling : le modèle écrit du JavaScript pour orchestrer les outils en dehors de son context window. Au lieu de raisonner sur 100 résultats intermédiaires, il les filtre en code et garde ses tokens pour le jugement.
  • Native compaction : les longues conversations sont compressées automatiquement, le modèle garde la cohérence sans reconstruire le contexte à chaque tour.

Utilisés ensemble, ces leviers changent la facture. Un agent qui coûtait 30$ par tâche peut tomber à 2 ou 3$ sans changer de qualité, si la délégation est bien configurée.

Le perf ChatGPT : fin du cauchemar des longues conversations

En parallèle de Multi-Agent v2, OpenAI a partagé des chiffres de performance front-end sur ChatGPT. Le test interne : une conversation de 741 tours, 231 MB. C'est le genre de session qu'un agent génère quand il lit du code, lance des tests, corrige et recommence.

MétriqueAvantAprès
Temps d'ouverture27,62 s1,66 s
Requêtes réseau89416
Entrées de session chargées15 52964
Mémoire totale1 030 MiB606 MiB

L'application ne charge plus tout l'historique à l'ouverture. Elle ne récupère que ce que tu vois, et le reste à la demande. Pour les développeurs qui font tourner des centaines d'appels d'outils dans Codex, l'interface reste fluide.

Un exemple chez Maisons&Mobilia

Sophie, PM chez Maisons&Mobilia (M&M, enseigne de meubles fictive), utilise un agent IA pour générer les fiches produit du catalogue e-commerce. L'agent enchaîne : lire un fichier source, extraire les specs, rédiger la description, vérifier la cohérence, formater en JSON.

Avant Multi-Agent v2, Sophie utilisait GPT-5.6 Terra pour tout. Chaque fiche prenait une dizaine d'appels, tous facturés au tarif Terra. Maintenant, Sol orchestre : il lit le fichier source et planifie (raisonnement frontier), puis délègue l'extraction et le formatage JSON à Luna. La rédaction reste sur Terra. Le résultat : le coût par fiche baisse de 60 à 70%, parce que les étapes mécaniques tournent sur le modèle le moins cher.

La limite : si une fiche produit est complexe (description marketing avec nuances, gestion de variants), Luna peut manquer de finesse. Sophie garde un humain pour valider les fiches difficiles. Mais 80% du catalogue est simple, et pour ces fiches, Luna suffit.

Ce que ça change si tu apprends l'IA

Multi-Agent v2 illustre une tendance qui va durer. Les agents IA ne vont plus utiliser un seul modèle. Ils vont en orchestrer plusieurs, chacun choisi pour une étape précise. C'est déjà ce que font les bons développeurs manuellement. OpenAI l'automatise.

Si tu apprends comment fonctionne un agent aujourd'hui, la délégation de tâches entre modèles est un concept qui devient central. Un agent n'est pas un modèle. C'est un système qui appelle des modèles, des outils et du code, et qui décide quoi utiliser quand. Multi-Agent v2 rend cette décision automatique.

Le deuxième enseignement, c'est le coût. Comprendre comment les tokens sont facturés, comment le cache fonctionne, comment le choix du modèle impacte la facture : c'est ce qui fait la différence entre un agent qui coûte 30$ et un agent qui coûte 2$ pour le même résultat. C'est exactement le genre de chose que saisir.ai enseigne dans ses modules sur les tokens, le tool use et le coût des agents.

Aller plus loin

Pour comprendre comment un agent IA utilise des modèles et des outils, notre article sur comment fonctionne un agent IA pose les bases. Pour voir comment le choix du modèle impacte le coût, le guide sur les familles de modèles compare les approches. Et pour t'entraîner à ces notions en 5 minutes par jour, l'app saisir.ai propose des modules interactifs sur les agents, le tool use et le coût des tokens, en français, sans coder.

Sources

Questions fréquentes

C'est quoi Multi-Agent v2 d'OpenAI ?
Multi-Agent v2 est une mise à jour du framework d'agents d'OpenAI, lancee le 16 août 2026. Elle permet au modele principal (GPT-5.6 Sol) de deleguer automatiquement des sous-taches a d'autres modeles de la famille (Terra, Luna), chacun avec son niveau de raisonnement reglable. Avant cette mise a jour, Luna etait bloquee en v1 et ne pouvait pas recevoir de taches de Sol.
Quelle difference entre GPT-5.6 Sol, Terra et Luna ?
Sol est le modele frontier, le plus puissant, pour le raisonnement complexe. Terra est le modele equilibre pour le travail quotidien. Luna est le plus rapide et le moins cher, optimise pour les taches a fort volume. Multi-Agent v2 permet a Sol de deleguer les taches simples a Luna, ce qui reduit le cout total de l'agent.
Combien on economise avec la delegation cross-model ?
OpenAI donne un exemple concret : sur BrowseComp, GPT-5.6 Luna en raisonnement extra-high fait le meme score que GPT-5.5 en raisonnement high, pour 1,33 $ au lieu de 33,27 $. Soit 25 fois moins cher. Sur ARC-AGI-3, les nouvelles options de retained reasoning et compaction font passer le score de 13,3% a 38,3% avec 6 fois moins de tokens en sortie.
Est-ce que Multi-Agent v2 est disponible pour tout le monde ?
Multi-Agent v2 est disponible dans ChatGPT et via l'API Responses d'OpenAI. Les developpeurs peuvent activer le multi-agent natif dans l'API. Dans ChatGPT, c'est aussi ce qui alimente le mode ultra. Greg Brockman, president d'OpenAI, a dit que l'objectif est de ne plus avoir a selectionner manuellement un modele.
Pourquoi c'est important pour quelqu'un qui apprend l'IA ?
Multi-Agent v2 illustre une tendance qui va durer : les agents IA ne vont plus utiliser un seul modele, mais plusieurs, chacun choisi automatiquement pour la tache. Si tu apprends comment fonctionne un agent, comprendre la delegation de taches entre modeles devient essentiel. C'est aussi un levier de cout majeur : utiliser le bon modele pour chaque etape peut diviser la facture par 10 ou 25.

Termes du glossaire