OpenAI ouvre le même modèle vocal GPT-Live-1 que ChatGPT aux développeurs. Le prix de l'API est de 0,05 USD par minute.

📅 2026-09-11

Résumé :

OpenAI a récemment annoncé que GPT-Live-1, actuellement utilisé pour la fonction vocale ChatGPT, serait officiellement ouvert aux développeurs. Les développeurs peuvent désormais intégrer ce modèle vocal dans leurs propres applications et processus métier via des API pour créer des assistants vocaux full-duplex capables d'écouter les utilisateurs en temps réel et de répondre en même temps. Le prix du frontal vocal de ce modèle est de 0,05 $ US par minute, et le modèle utilisé en arrière-plan pour un raisonnement complexe doit être facturé séparément en fonction du prix du modèle correspondant.

1789093911_chatgpt_voice.webp

GPT-Live-1 est une nouvelle génération de modèle vocal en temps réel lancée par OpenAI cette année. Sa plus grande caractéristique est son architecture full-duplex. L’IA vocale traditionnelle doit généralement effectuer en séquence les trois étapes de la reconnaissance vocale, de l’inférence du modèle linguistique et de la synthèse vocale. Ce n'est qu'une fois que l'utilisateur a fini de parler que le système peut commencer le traitement et générer des réponses. GPT-Live-1, d'autre part, peut générer une sortie vocale tout en écoutant l'utilisateur parler, de sorte qu'il peut gérer plus naturellement les interruptions, les pauses, les échos et les conversations rapides.

Cela signifie que les utilisateurs n'ont pas besoin d'attendre que l'IA ait fini de parler complètement avant de continuer à parler. Si l'utilisateur change d'avis, ajoute des informations ou interrompt directement, GPT-Live-1 peut ajuster son comportement dans le temps en fonction de la conversation en cours. Le modèle peut également indiquer quand continuer à parler, quand faire une pause, quand continuer à écouter et quand faire appel à des outils.

OpenAI a déclaré que cette architecture peut réduire considérablement le délai d'interaction vocale et résoudre les problèmes de connexion susceptibles de se produire dans les conversations réelles dans le pipeline traditionnel « reconnaissance vocale + grand modèle de langage + synthèse vocale ». Étant donné que GPT-Live-1 gère lui-même à la fois l’audio d’entrée et de sortie, les développeurs n’ont plus besoin de coordonner une commutation complexe entre plusieurs modèles indépendants.

Dans le test publié par OpenAI, les performances de GPT-Live-1 dans le test Full Duplex Bench étaient 30 points de pourcentage supérieures à celles de GPT-Realtime-2.1, notamment en termes de délai de prise de tour et de comportement interactif. Lorsqu'il est associé à GPT-6 Astra à une intensité d'inférence moyenne, GPT-Live-1 a également obtenu la première place au test Tau3. Tau3 est principalement utilisé pour évaluer la capacité des agents vocaux à effectuer des tâches de bout en bout.

Une autre caractéristique importante de GPT-Live-1 est qu'il n'est pas responsable de tous les travaux de raisonnement complexes. OpenAI sépare le modèle vocal responsable de l'écoute, de la parole et de l'interaction en temps réel du modèle d'arrière-plan responsable du raisonnement profond. Lorsque les utilisateurs posent des questions nécessitant une recherche, une analyse complexe ou des tâches longues, GPT-Live-1 peut confier ces tâches au modèle d'arrière-plan tout en continuant à maintenir une communication vocale naturelle avec l'utilisateur.

Les développeurs sont donc libres de choisir des modèles backend en fonction des besoins spécifiques de leur entreprise. Par exemple, pour un grand nombre de tâches simples telles que les réservations et les mises à jour des commandes, des modèles plus rapides et moins coûteux peuvent être utilisés ; pour les problèmes clients complexes, ils peuvent être traités par des modèles d’inférence plus puissants. Cette architecture permet aux développeurs de trouver un équilibre entre réactivité, capacités de raisonnement et coût d'utilisation.

OpenAI a déclaré que cette conception découplée permet également à GPT-Live-1 de continuer à communiquer avec les utilisateurs tout en effectuant des tâches en arrière-plan, au lieu de laisser les utilisateurs faire face à une longue période d'attente silencieuse. Le modèle peut poursuivre une conversation naturelle tout en effectuant un travail plus complexe en arrière-plan, puis ramener les résultats à la conversation en cours une fois la tâche terminée.

Des applications pratiques commencent déjà à émerger. Les premiers exemples démontrés par OpenAI incluent des services vocaux tels que Yelp Host et Hatch, ainsi que la plateforme d'apprentissage des langues Speak. Selon les premières évaluations, par rapport aux systèmes vocaux au tour par tour précédents, GPT-Live-1 peut donner aux apprenants en langues plus de temps pour réfléchir, réduisant ainsi de près de 80 % le nombre d'interruptions proactives du système pour les utilisateurs.

Pour les entreprises, cette fonctionnalité est particulièrement adaptée au service client, au service client par téléphone, aux réservations et à d'autres scénarios nécessitant une interaction vocale continue. GPT-Live-1 prend en charge de manière native les scénarios téléphoniques, afin que les développeurs puissent l'utiliser pour créer des agents vocaux en duplex intégral capables de répondre et de gérer les appels téléphoniques, tels que les réservations de restaurant, le support client et d'autres entreprises nécessitant une communication en temps réel.

GPT-Live-1 fournit également une reconnaissance vocale automatique native du texte transcrit et du modèle de texte de réponse, et améliore la compréhension des combinaisons alphanumériques, tout en prenant en charge les fonctions de biais de mots clés. Bien qu’il ne s’agisse pas d’un modèle au tour par tour au sens traditionnel du terme, il prend toujours en charge la détection des virages de manière native. Par conséquent, si les développeurs ont besoin de contrôler clairement le moment où l’utilisateur finit de parler et le moment où le système commence à répondre, ils peuvent toujours concevoir leurs applications autour de dialogues clairs.

GPT-Live-1 a également été optimisé pour les scènes avec des environnements d'arrière-plan bruyants. Le modèle permet de mieux distinguer la parole de l'utilisateur, le bruit de fond et le silence. Il n'interrompra pas fréquemment les conversations en raison des sons de l'environnement, et il ne rappellera pas constamment aux utilisateurs qu'ils réfléchissent brièvement. Cette fonctionnalité est particulièrement importante pour les appels téléphoniques, le service client et les assistants vocaux mobiles dans des environnements réels.

OpenAI a également élargi la sélection de sons disponible pour GPT-Live-1. Par rapport au nombre relativement limité de voix en temps réel précédemment disponibles, la nouvelle version offre des voix plus diversifiées et couvre une gamme plus riche d'accents, de dialectes et de langues. OpenAI indique qu'il continuera d'ajouter des voix et des langues disponibles dans les mois à venir.

En termes de déploiement de modèles, les développeurs n'ont pas besoin de confier toutes les tâches à GPT-Live-1. OpenAI espère l'utiliser comme frontal responsable de l'interaction vocale en temps réel, en prenant en charge des travaux plus complexes via des modèles d'arrière-plan et des cadres d'agents. Cette approche permet également aux développeurs de combiner différents modèles en fonction des besoins réels des différentes tâches.

Par exemple, les développeurs peuvent laisser GPT-Live-1 se charger de la réception des demandes vocales des utilisateurs, du maintien des conversations naturelles et de la gestion des interruptions, puis confier les questions qui nécessitent un raisonnement complexe au modèle d'arrière-plan ; une fois le travail du modèle d'arrière-plan terminé, GPT-Live-1 convertit les résultats en réponses vocales naturelles. Ce mécanisme s'applique également aux applications qui ont besoin d'appeler des outils externes.

OpenAI a également montré comment combiner GPT-Live-1 avec des outils tels que Codex. Les développeurs peuvent laisser le modèle vocal recevoir les tâches proposées par l'utilisateur, puis transférer le contexte pertinent vers des outils d'arrière-plan tels que Codex pour le traitement, puis renvoyer les résultats du traitement à GPT-Live-1, qui continuera à communiquer avec l'utilisateur via la voix.

En termes de prix, GPT-Live-1 est désormais officiellement disponible via l'API OpenAI, et le frontal vocal coûte 0,05 $ par minute. Il est important de noter qu’il ne s’agit que du coût du niveau voix en temps réel. Si le développeur équipe GPT-Live-1 d'un modèle d'inférence en arrière-plan, le coût d'appel du modèle en arrière-plan doit être calculé séparément en fonction de la tarification du modèle correspondant.

Cela signifie que pour les applications professionnelles qui nécessitent un grand nombre d'appels vocaux, le coût réel n'est pas seulement de 0,05 $ par minute, mais comprend le temps de connexion vocale et la consommation d'inférence du modèle d'arrière-plan. Cependant, les développeurs peuvent contrôler le coût global en fonction de la complexité de la tâche en choisissant différents modèles back-end.

L'ouverture de GPT-Live-1 signifie également qu'OpenAI étend davantage la technologie de base derrière le mode vocal ChatGPT des produits grand public à l'écosystème des développeurs. Auparavant, GPT-Live-1 existait principalement en tant que capacité d'interaction vocale de ChatGPT. Les développeurs peuvent désormais utiliser directement des technologies similaires pour créer leurs propres applications et agents vocaux.

D'un point de vue technique, OpenAI espère que GPT-Live-1 permettra non seulement de « permettre à l'IA de parler », mais permettra également à l'IA de véritablement participer à des conversations naturelles continues, en temps réel et interrompues. En divisant l'écoute, la parole, l'interaction en temps réel et le raisonnement profond, OpenAI tente d'obtenir en même temps une latence vocale plus faible, une expérience de conversation plus naturelle et des capacités de traitement des tâches en arrière-plan plus fortes.

À mesure que les agents vocaux passent progressivement de simples questions et réponses vocales à des tâches complexes telles que le service client téléphonique, les réservations, l'enseignement des langues, le traitement commercial et la capacité d'appeler de manière autonome des outils pour effectuer des tâches, l'importance des modèles vocaux en temps réel augmente également. L'API ouverte de GPT-Live-1 signifie que les développeurs peuvent désormais intégrer directement la génération actuelle de technologie vocale en temps réel utilisée par ChatGPT dans leurs propres produits, et le prix de la couche vocale de 0,05 USD par minute permet également à cette capacité d'entrer officiellement dans la phase d'application commerciale.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire