Résumé :
OpenAI a annoncé que l'application mobile ChatGPT a commencé à ajouter des fonctions d'agent intelligent basées sur la voix. À l'avenir, les utilisateurs pourront non seulement discuter avec ChatGPT par la voix, mais également lui commander directement d'effectuer des travaux pratiques plus complexes en utilisant la voix. Par exemple, les utilisateurs peuvent demander à ChatGPT de créer un document, de rédiger un e-mail, de résumer un message Slack ou même d'effectuer une série de tâches nécessitant plusieurs étapes.

L'essentiel de cette mise à jour est d'apporter aux téléphones mobiles les fonctionnalités de travail agent que ChatGPT a progressivement ajoutées au bureau. Pour les utilisateurs Plus et Pro, l'onglet Travail du téléphone mobile peut désormais être utilisé directement pour créer des documents, rédiger des e-mails et résumer les messages Slack. Il peut également effectuer des flux de travail plus complexes tels que la création de sites Web, la réalisation de présentations, l'utilisation de navigateurs cloud et la gestion de tâches liées aux finances.
Pour les utilisateurs Free and Go, OpenAI se concentre sur l'utilisation de plug-ins et d'applications connectées. Cela signifie que les utilisateurs de différents niveaux d'abonnement peuvent faire fonctionner ChatGPT avec des outils et des applications externes, mais la gamme spécifique de fonctions disponibles diffère.
Cette mise à jour modifie également le comportement du mode vocal ChatGPT lui-même. OpenAI a déclaré que les conversations vocales peuvent désormais fournir une sortie de texte plus riche et que les utilisateurs peuvent voir des informations textuelles plus complètes en même temps lorsqu'ils communiquent avec ChatGPT. De plus, les utilisateurs peuvent également basculer plus facilement entre les modes texte et vocal sans avoir à mettre fin à la conversation en cours et à la recommencer.
Le travail continu sur tous les appareils constitue également un élément important de cette mise à jour. Les utilisateurs peuvent utiliser leur téléphone mobile pour demander à ChatGPT de commencer à traiter une tâche vocalement lorsqu'ils sont absents, puis de revenir à l'ordinateur pour continuer à visualiser et à terminer la tâche. En d’autres termes, le téléphone mobile est principalement chargé de donner des instructions et de démarrer des tâches à tout moment, tandis que le bureau peut continuer à gérer des flux de travail plus complexes.
Ce changement est lié à l'investissement continu d'OpenAI dans l'interaction vocale ces dernières années. En juillet de cette année, OpenAI a lancé un nouveau modèle vocal GPT-Live, axé sur l'amélioration du dialogue naturel, du traitement des interruptions et des capacités de communication continue. Par la suite, OpenAI a apporté cette capacité vocale aux applications de bureau, permettant aux utilisateurs de contrôler l'agent intelligent dans ChatGPT Work par la voix ou d'effectuer des tâches de développement logiciel dans Codex.
Les versions de bureau précédentes permettaient déjà aux utilisateurs d'émettre des commandes complexes en plusieurs étapes par la voix. Par exemple, les développeurs peuvent directement demander à ChatGPT de créer un nouveau fil de code, de soumettre une Pull Request et de trouver la cause première d'une vulnérabilité d'un programme sans avoir à parcourir chaque opération. Cette mise à jour mobile suit essentiellement cette idée, mais étend davantage les capacités de contrôle vocal et d'agent intelligent aux téléphones mobiles.
OpenAI estime que la voix devient un moyen important permettant aux utilisateurs d'interagir avec l'IA pour accomplir des tâches complexes. Au lieu d'avoir à s'arrêter et à taper du texte, les utilisateurs peuvent indiquer directement à l'IA ce qui doit être fait par la voix tout en marchant, en se déplaçant ou en faisant d'autres choses, puis laisser l'agent intelligent continuer à l'exécuter en arrière-plan.
Cette tendance est également cohérente avec le positionnement précédent d'OpenAI en matière de technologie vocale. La société a déclaré qu'elle espère qu'à mesure que les capacités des modèles continuent de s'améliorer, la voix deviendra à terme une méthode d'interaction informatique majeure et que les utilisateurs pourront continuer à commander à l'IA d'accomplir des tâches de plus en plus complexes et de plus en plus longues via le langage naturel.
OpenAI a également démontré cette orientation de développement en lançant GPT-Live en juillet de cette année. Le nouveau modèle vocal peut non seulement gérer les interruptions des utilisateurs de manière plus naturelle, mais également faire appel à des modèles de texte plus avancés pour les tâches de recherche, de raisonnement et d'agent lors d'une communication vocale continue. De cette façon, le mode vocal n'est plus seulement une interface chargée de « parler », mais est progressivement devenu l'entrée pour contrôler l'ensemble du système de travail de l'IA.
Cette mise à jour mobile signifie également qu'OpenAI change progressivement le positionnement de l'application mobile ChatGPT. Dans le passé, la version mobile de ChatGPT était principalement responsable de tâches telles que les questions et réponses, la recherche, la rédaction et le chat vocal. Les utilisateurs peuvent désormais démarrer un flux de travail complet directement depuis leur téléphone mobile et laisser l’IA terminer l’opération proprement dite dans les applications et outils connectés.
Dans le même temps, l'approche d'OpenAI est également en concurrence avec la direction prise par ses concurrents. Anthropic a également récemment renforcé les capacités de collaboration mobile et de bureau de Claude, et intégré davantage les interfaces de chat de Cowork et Claude, permettant aux utilisateurs de lancer des tâches à partir d'appareils mobiles, puis de les transférer vers le bureau pour poursuivre le traitement. Toutefois, les deux sociétés ont encore des choix différents en matière de structure de produits. OpenAI sépare toujours l'interface de discussion ordinaire des espaces de travail tels que Work.
À en juger par la feuille de route actuelle des produits OpenAI, la voix, les agents intelligents et le travail multi-appareils s'intègrent progressivement. À l’avenir, les utilisateurs n’auront plus nécessairement besoin d’ouvrir une application spécifique, de rechercher des boutons spécifiques, puis d’utiliser le logiciel étape par étape. Au lieu de cela, ils peuvent énoncer directement leurs objectifs, et ChatGPT sera chargé de comprendre la tâche, d'appeler les outils et d'exécuter plusieurs étapes.
Cette mise à jour mobile n'ajoute pas seulement une fonction de chat vocal, mais permet également à ChatGPT sur le téléphone mobile de commencer à avoir la possibilité de « fonctionner par commande vocale ». Alors qu'OpenAI continue d'améliorer des produits tels que GPT-Live et Work, le mode vocal de ChatGPT se transforme progressivement d'un simple outil de conversation à un portail connectant les utilisateurs avec des agents d'IA, des applications externes et de véritables flux de travail numériques.
Commentaires