Actualite · Outils IA
GPT-Live-1 : construire un agent vocal qui parle et écoute en meme temps
13 septembre 2026 · 5 min de lecture

OpenAI a ouvert GPT-Live-1 dans son API le 10 septembre 2026. C'est un modele de voix full-duplex : il ecoute et parle en meme temps, sans attendre que tu finisses pour commencer a repondre. La voix qui equipait ChatGPT depuis juillet 2026 est maintenant accessible aux developpeurs, a 0,05 dollar par minute.
L'idee centrale : au lieu de chainer reconnaissance vocale, modele de raisonnement et synthese vocale en trois etapes separées, GPT-Live-1 gere l'audio dans un seul modele. Quand une question a besoin de reflexion ou d'un outil, il delegue a un modele backend (GPT-6 Astra, GPT-5.6 Terra ou autre) et continue a te parler pendant que le travail se fait en arriere-plan.
Le probleme qu'il regle
Les agents vocaux d'avant GPT-Live-1 utilisaient une architecture en cascade : speech-to-text, puis un LLM, puis text-to-speech. Chaque transition ajoutait de la latence et des points de rupture. Le plus penible, c'etait la gestion des tours. Un petit modele detecteur de silence devait deviner quand tu avais fini de parler. S'il se trompait trop tot, il te coupait la parole. Trop tard, et la conversation trainait.
GPT-Live-1 supprime ce detecteur du chemin audio. Le modele ecoute et parle en continu. Il peut glisser un "mhmm" pendant que tu cherches tes mots, rester silencieux quand tu reflechis, et accepter une interruption en plein milieu de sa phrase sans perdre le fil.
Dans les evaluations d'OpenAI, GPT-Live-1 gagne 30 points sur le Full Duplex Bench par rapport a GPT-Realtime-2.1, son predecessor. Speak, une appliation d'apprentissage de langues, rapporte 80% d'interruptions indesirables en moins par rapport aux anciens systemes a tours.
Comment ca marche en pratique
Tu ouvres une session API avec GPT-Live-1 comme couche vocale. Tu choisis un modele backend pour le raisonnement (GPT-6 Astra en effort moyen, par exemple). Tu connectes tes outils : recherche web, appel d'API, base de connaissances.
La conversation se deroule ainsi. L'utilisateur parle. GPT-Live-1 traite l'audio en temps reel, repond vocalement pour les interactions simples, et delegue au backend des qu'il faut chercher, calculer ou appeler un outil. Le backend travaille en asynchrone. La conversation continue pendant ce temps. Quand le backend a sa reponse, GPT-Live-1 la reintegre dans le flux vocal.
Cote technique : l'API supporte le streaming audio, le function calling, et la telephonie. 12 voix sont disponibles au lancement, avec possibilite de voix personnalisees via l'equipe commerciale d'OpenAI. Les entrees et sorties sont audio et texte (pas d'images ni de video). Le cutoff de connaissances du modele vocal est juillet 2025, ce qui est volontaire : la voix ne doit pas etre la source de verite, c'est le backend qui sait les choses recentes.
Le prix, et ce qu'il cache
0,05 dollar par minute pour la couche vocale. C'est le plancher, pas la facture. Ton cout reel a trois etages.
La voix : 0,05 $/min, facturee a la seconde.
Le backend : le modele de raisonnement que tu choisis, facture separement. GPT-6 Astra en effort moyen ne coute pas pareil que GPT-5.6 Terra en effort bas.
L'infrastructure : ton agent harness, tes outils, tes integrations (telephonie, CRM, base de connaissances).
Un developpeur, Tony Stoyanov, raconte que la migration vers GPT-Live-1 a permis de couper 23 000 lignes de code et de simplifier sa codebase de 80% pour une appli de sante. La simplification vient de l'elimination du pipeline STT-LLM-TTS et de toute la logique de gestion des tours.
Un exemple chez Maisons&Mobilia
Sophie, responsable support client chez Maisons&Mobilia (M&M, enseigne de meubles fictive), gere une equipe de 15 conseillers. Le volume d'appels augmente, les delais d'attente s'allongent, et les appels simples (statut de commande, horaires de livraison, disponibilite d'un produit) occupent les conseillers qui devraient traiter les cas complexes.
Sophie veut un agent vocal qui repond aux appels simples et bascule vers un humain quand c'est necessaire. Avant GPT-Live-1, elle aurait du assembler trois composants : un service de reconnaissance vocale, un LLM avec un system prompt, et un service de synthese vocale. Puis coder la logique de detection de fin de phrase, la gestion des interruptions, et la coordination entre les trois. Estimation : 4 a 6 semaines de developpement pour un prototype qui sonnerait encore un peu robotique.
Avec GPT-Live-1, Sophie branche le modele vocal sur son API de support existante. L'agent repond au telephone, ecoute le client, et delegue les requetes au backend qui interroge le systeme de commandes. Pour un statut de livraison, le backend repond en 2 secondes, et GPT-Live-1 formule la reponse vocalement. Si le client dit "attendez, c'est pour la commande de vendredi, pas celle de lundi" en plein milieu de la reponse, l'agent suit le changement sans recomencer.
La limite : si un client appelle pour une reclamation complexe (produit endommage, remboursement partial, litige), l'agent vocal doit detecter qu'il ne peut pas traiter seul et basculer vers un humain. Cette logique de bascule, c'est Sophie qui la code dans le backend, pas GPT-Live-1. Le modele vocal gere la conversation. Le jugement, c'est le metier.
Ce que ca change si tu apprends l'IA
-
La voix n'est plus une chimie en trois etapes. Comprendre l'architecture full-duplex, c'est comprendre pourquoi on parle d'agents vocaux et plus de chatbots vocaux. Un chatbot vocal reformule. Un agent vocal ecoute, delegue, et continue la conversation pendant que le travail se fait.
-
Le modele vocal et le modele de raisonnement sont separés. GPT-Live-1 ne sait pas grand-chose (cutoff juillet 2025). Il s'appuie sur un backend pour la connaissance. Cette separation est un pattern qui va se generaliser : un modele rapide et leger pour l'interaction en temps reel, un modele lourd pour la reflexion. Comprendre ca, c'est savoir pourquoi l'architecture agentique importe plus que le choix d'un seul modele.
-
Le cout est la variable qui determine ce qui est faisable. 0,05 $/min pour la voix, plus le backend, plus l'infrastructure. Pour un centre d'appels qui traite 10 000 minutes par jour, la couche vocale seule coute 500 dollars/jour. Si le backend ajoute 50% de plus, on est a 750 dollars/jour. C'est moins cher que des humains, mais c'est pas gratuit. La competence pratique : estimer le cout d'un agent vocal avant de le construire, pas apres.
Aller plus loin
Pour comprendre comment un agent IA utilise des outils et enchaene des etapes, notre article sur comment fonctionne un agent IA pose les bases du tool use et de l'orchestration. Pour voir les garde-fous a mettre en place quand un agent accede a tes donnees, le guide sur les garde-fous des agents IA detaille le moindre privilege et le human in the loop. Pour comprendre le contexte de la bataille des frontier, notre article sur GPT-6 Astra et l'ere AGI couvre le modele qui alimente le backend de GPT-Live-1. Et pour t'entrainer a ces notions en 5 minutes par jour, l'app saisir.ai propose des modules interactifs sur les modeles, les agents et le deploiement, en francais, sans coder.
Sources
- OpenAI, "Build more natural voice experiences with GPT-Live-1 in the API", 10 septembre 2026
- Coursiv, "GPT-Live-1 in the API: Pricing, Full-Duplex Voice, and the Configuration Behind Every Benchmark", 11 septembre 2026
- eesel AI, "GPT-Live-1 review: is OpenAI's full-duplex voice model worth it?", 11 septembre 2026
- Unite.AI, "OpenAI's GPT-Live-1 Arrives in the API at $0.05 Per Minute", 10 septembre 2026
- Twilio, "Build Voice AI Experiences with Twilio and GPT-Live-1", 10 septembre 2026
Questions fréquentes
- C'est quoi GPT-Live-1 ?
- GPT-Live-1 est le modele de voix full-duplex d'OpenAI, ouvert dans l'API le 10 septembre 2026. Il peut ecouter et parler en meme temps, sans attendre la fin de ton tour pour repondre. C'est la voix qui equipait deja ChatGPT depuis juillet 2026, desormais accessible aux developpeurs via API.
- Combien coute GPT-Live-1 ?
- La couche vocale coute 0,05 dollar par minute, facturee a la seconde. Mais c'est un plancher, pas la facture finale : tu paies aussi le modele de raisonnement auquel il delegue (GPT-6 Astra, GPT-5.6 Terra ou autre), ainsi que les outils et l'infrastructure que tu branches derriere. Le cout total depend de ce que ton agent fait.
- Quelle difference entre GPT-Live-1 et les anciens modeles vocaux ?
- Les anciens systemes chainaient trois etapes : reconnaissance vocale, raisonnement, synthese vocale. Chaque transition ajoutait de la latence et des erreurs. GPT-Live-1 gere l'ecoute et la parole dans un seul modele, ce qui elimine les handoffs. Il peut dire 'mhmm' pendant que tu parles, accepter les interruptions, et garder le fil d'une conversation longue.
- GPT-Live-1 peut-il passer des appels telephoniques ?
- Oui. L'API supporte la telephonie, ce qui permet de deployer des agents vocaux pour des appels telephoniques : reservations de restaurant, support client, prises de rendez-vous. Twilio propose deja une integration avec GPT-Live-1 pour construire des flux vocaux.
- Faut-il etre developpeur pour utiliser GPT-Live-1 ?
- Oui. GPT-Live-1 est une API destinee aux developpeurs. Il n'y a pas de version grand public en dehors de ChatGPT. Pour l'utiliser, il faut savoir integrer une API, gerer des sessions audio en streaming, et configurere un modele de backend pour le raisonnement.