Résumé :
Microsoft renforce encore les capacités vocales en temps réel de la plate-forme Foundry, en fournissant aux développeurs des agents vocaux natifs capables d'effectuer directement des entrées et des sorties vocales, ce qui permet aux entreprises de créer plus facilement des expériences d'IA conversationnelles en temps réel similaires à Google Gemini Live.

Le principal changement apporté par la mise à jour de Microsoft est que Foundry Agent Service commence à prendre en charge les fonctionnalités vocales natives en temps réel. Différent du processus des agents d'IA traditionnels qui convertissent d'abord la parole en texte, puis la transmettent au modèle de texte pour traitement, et enfin reconvertissent le texte en parole, l'architecture vocale native peut directement permettre au modèle vocal en temps réel de traiter la saisie vocale de l'utilisateur et de générer une réponse vocale, réduisant ainsi les liens intermédiaires et les retards qui en résultent.
Pour les utilisateurs, cela signifie que les agents IA peuvent engager des conversations continues plus naturellement. Les utilisateurs n'ont pas besoin d'attendre que la reconnaissance vocale soit terminée ou que le modèle génère une réponse textuelle complète avant de lancer la synthèse vocale. Le système peut être plus proche de la méthode de communication en temps réel entre les personnes et peut gérer des aspects clés de l'interaction vocale tels que l'interruption et le jugement de virage.
Les fonctionnalités de Microsoft reposent sur l'API Voice Live. Cette interface intègre des fonctions telles que la reconnaissance vocale, l'IA générative, la synthèse vocale, la détection des virages et le traitement des interruptions dans une interface vocale en temps réel unifiée, permettant aux développeurs d'ajouter des capacités d'interaction vocale en temps réel à leurs agents IA sans avoir à créer plusieurs composants vocaux séparément.
Pour les entreprises qui ont utilisé Foundry Agent Service pour créer des agents IA, cela signifie que les agents textuels d'origine peuvent obtenir davantage de capacités d'interaction vocale, tout en continuant à utiliser l'appel de l'outil d'origine, la base de connaissances, la mémoire, la protection de la sécurité du contenu et les capacités d'intégration de données et de services au niveau de l'entreprise.
Microsoft souligne particulièrement que l'agent vocal n'est pas seulement un chatbot capable de « lire les réponses », mais peut appeler des outils et effectuer des tâches lors d'une communication vocale en temps réel. Par exemple, les entreprises peuvent utiliser cette technologie pour créer des systèmes de service client permettant aux utilisateurs de communiquer directement avec des agents IA par téléphone ; il peut également être utilisé pour des services sans obstacle, des applications axées sur la voix et divers systèmes internes d'entreprise qui nécessitent une interaction vocale naturelle.
En termes d'architecture technique, Foundry prend actuellement en charge deux principales routes d'agent vocal. L’un est le pipeline vocal traditionnel, qui convertit la parole de l’utilisateur en texte, puis la transmet au modèle de texte pour inférence et enfin convertit le texte généré en parole. L’autre est la synthèse vocale native sur laquelle se concentre cette fois-ci, à savoir l’architecture parole-parole. Le modèle vocal en temps réel traite directement l'entrée vocale et génère une sortie vocale.
Le plus grand avantage de l'architecture vocale native est qu'elle réduit la latence tout en conservant mieux la tonalité, les pauses et le rythme de communication des conversations naturelles. Pour les scénarios qui nécessitent une communication continue, cette méthode est plus proche d'une conversation réelle en temps réel que la solution traditionnelle en plusieurs étapes de « reconnaissance vocale → modèle de texte → synthèse vocale ».
Microsoft continue également d'améliorer les capacités d'interaction en temps réel de l'API Voice Live. Les mises à jour récentes ont ajouté de nouveaux types de parole natifs en temps réel et des fonctionnalités encore améliorées telles que l'annulation de l'écho, la détection de fermeture intelligente et l'invocation d'outils parallèles. L'annulation d'écho est particulièrement adaptée aux agents vocaux fonctionnant sur du matériel personnalisé ou des liaisons audio non standard. Cela permet au système de se référer au son réellement joué par le client, réduisant ainsi le problème de mauvaise reconnaissance une fois que l'IA a entendu sa propre voix.
En plus de la voix elle-même, Microsoft renforce également le positionnement de Foundry en tant que plate-forme de développement et d'exploitation d'agents d'IA au niveau de l'entreprise. Foundry Agent Service peut être responsable de la gestion du cycle de vie des agents intelligents et fournir des capacités de sécurité, de contrôle des autorisations, d'isolation du réseau, de suivi des opérations et d'évaluation au niveau de l'entreprise. De cette manière, les entreprises n’ont pas besoin de créer une infrastructure de toutes pièces pour le fonctionnement, la surveillance et la communication vocale des agents IA.
La décision de Microsoft vise évidemment également Gemini Live, que Google n'a cessé de renforcer ces dernières années. Gemini Live est devenu un produit important pour Google pour démontrer les capacités d'IA vocale en temps réel aux consommateurs, tandis que Microsoft met l'accent sur la fourniture de capacités vocales en temps réel similaires directement aux développeurs d'entreprise, permettant aux entreprises de créer une intelligence vocale exclusive basée sur leurs propres données, outils et processus commerciaux.
Le positionnement des deux n'est donc pas exactement le même. Gemini Live offre principalement une expérience vocale IA directement utilisable pour les utilisateurs ordinaires, tandis que Microsoft Foundry est davantage orienté vers les entreprises et les développeurs. L'objectif est de permettre aux entreprises d'intégrer des capacités vocales en temps réel dans le service client, les systèmes téléphoniques, les activités internes et d'autres applications professionnelles.
Ces dernières années, Microsoft a favorisé le développement d'agents IA, depuis de simples chatbots jusqu'à des systèmes capables d'effectuer des tâches de manière autonome. Avec l'ajout de capacités vocales à ce système, l'interaction entre les utilisateurs et les agents s'est progressivement étendue de la saisie au clavier à des conversations plus naturelles en temps réel. Non seulement les agents peuvent répondre aux questions, mais ils peuvent également appeler des outils, accéder aux données de l'entreprise et effectuer des tâches spécifiques au cours des conversations.
Actuellement, Microsoft intègre progressivement des fonctionnalités telles que Foundry Agent Service, Voice Live et des agents gérés dans la même plate-forme d'IA d'entreprise. À mesure que ces technologies évoluent, l’infrastructure que les entreprises doivent développer et entretenir elles-mêmes pour créer un service client vocal en temps réel, des agents téléphoniques, des assistants vocaux et d’autres services d’IA sera encore réduite.
Cela signifie également que la concurrence pour les assistants vocaux IA passe de la simple comparaison de modèles « s'ils peuvent discuter » à la comparaison de ceux qui peuvent fournir une interaction vocale à faible latence, des capacités d'appel d'outils plus complètes, une infrastructure d'entreprise plus fiable et un environnement de développement plus pratique. L'ajout par Microsoft d'un agent vocal natif en temps réel à Foundry constitue une étape importante dans l'expansion de sa configuration d'agent vocal sur le marché de l'IA d'entreprise.
Commentaires