OpenAI a annoncé le 10 septembre 2026 l’arrivée de l’API GPT-Live-1, qui permet aux développeurs de construire des applications capables de parler et d’écouter en même temps — la conversation full-duplex jusqu’ici réservée à ChatGPT devient accessible en dehors de l’app. Le modèle est facturé 0,05 $ par minute d’utilisation, avec un ciblage clair sur les usages vocaux professionnels : centres d’appels, assistants embarqués, service client automatisé.

Un bond net sur la latence et la précision

OpenAI met en avant plusieurs chiffres de performance par rapport à GPT-Realtime-2.1, le modèle jusque-là utilisé pour ce type d’applications. Le taux d’interactivité full-duplex — la capacité à gérer une conversation où les deux parties peuvent parler en même temps sans se couper la parole — grimpe à 80,1 %, contre 45,4 % auparavant. La latence de prise de parole tombe à 0,8 seconde, contre 1,4 seconde avec l’ancien modèle.

La précision d’appel d’outils (tool-calling), essentielle pour qu’un agent vocal déclenche la bonne action pendant l’échange — réserver, annuler, vérifier un solde — passe de 60 % à 87 %. Sur un benchmark spécifique au secteur bancaire, le taux de réussite grimpe de 12,4 % à 32 %, un signal qu’OpenAI cible explicitement les usages professionnels à fort enjeu de fiabilité comme la banque ou l’assurance.

Douze voix et des transcriptions automatiques

L’API embarque douze nouvelles voix couvrant différents accents, dialectes et langues, accompagnées d’une transcription automatique (ASR) et de la génération du texte de réponse en parallèle de l’audio. Les développeurs peuvent aussi combiner GPT-Live-1 avec différents modèles de raisonnement en arrière-plan, pour arbitrer entre profondeur de raisonnement, vitesse et coût selon l’usage visé — un agent de support client n’a pas les mêmes besoins qu’un standard téléphonique automatisé.

Yelp déjà en production

Yelp fait partie des premiers déploiements en conditions réelles, pour la prise de réservation de restaurants par téléphone. Selon Alex Levy, CTO de Yelp, l’entreprise constate une nette amélioration de la gestion des appels depuis le passage à GPT-Live-1, notamment sur la fluidité des échanges et la capacité du système à gérer les interruptions des appelants.

Cette API fait suite au lancement grand public de GPT-Live-1 dans ChatGPT en juillet 2026, où le modèle avait déjà introduit le mode full-duplex pour les conversations vocales avec l’assistant. En l’ouvrant aux développeurs sous forme d’API, OpenAI fait passer cette capacité du statut de confort d’usage à celui de brique d’infrastructure pour construire des agents vocaux professionnels — un terrain où l’entreprise entre en concurrence directe avec les offres vocales de Google et une multitude de startups spécialisées comme ElevenLabs ou Vapi.

Combien coûte l’API GPT-Live-1 ?

OpenAI facture l’API GPT-Live-1 0,05 dollar par minute d’utilisation.

En quoi l’API GPT-Live-1 diffère-t-elle du GPT-Live-1 déjà présent dans ChatGPT ?

Le modèle vocal full-duplex existait déjà dans ChatGPT depuis juillet 2026. La nouveauté est de le rendre accessible via une API, pour que des développeurs tiers construisent leurs propres applications vocales, comme l’a fait Yelp pour la réservation de restaurants par téléphone.

Quelles améliorations techniques apporte GPT-Live-1 par rapport à GPT-Realtime-2.1 ?

Le taux d’interactivité full-duplex passe de 45,4 % à 80,1 %, la latence de prise de parole tombe de 1,4 à 0,8 seconde, et la précision d’appel d’outils passe de 60 % à 87 %.

Share.
Exit mobile version