Microsoft lance le modèle de transcription et de synthèse vocale en temps réel MAI-Transcribe-2-Streaming, se classant premier dans la liste de reconnaissance du streaming

📅 2026-10-02

Résumé :

Microsoft a lancé trois nouveaux modèles d'interaction vocale en temps réel, à savoir le modèle de synthèse vocale MAI-Transcribe-2-Streaming et les modèles de synthèse vocale MAI-Voice-2.1 et MAI-Voice-2.1-Flash. Microsoft espère que les développeurs les combineront pour créer des assistants vocaux et des agents conversationnels capables de traiter tout en écoutant et de répondre instantanément avec une parole naturelle.

MAI-Transcribe-2-Streaming est différent du précédent MAI-Transcribe-2 qui ne peut traiter que les fichiers d'enregistrement. Il peut recevoir des flux audio d'entrée continus et commencer à générer du texte mis en scène avant que l'orateur ait fini de parler. Il continuera à être révisé à mesure que le contexte viendra et soumettra enfin des résultats stables. Microsoft a déclaré que le modèle prend en charge 60 langues et peut reconnaître les langues en continu et automatiquement ; le premier lot de reconnaissance est supposé apparaître un peu plus de 100 millisecondes après la réception de l'audio et convient à des scénarios tels que les agents vocaux, le service client, les sous-titres de conférence et de classe et la saisie vocale. Les tests internes de Microsoft sur la dictée et les sous-titres montrent que le texte apparaît environ deux fois plus vite que celui du concurrent le plus proche, une comparaison basée sur les propres critiques de l'entreprise.

Le benchmark de transcription en streaming d'Artificial Analysis classe le modèle au premier rang pour la précision du texte final et par étapes. Les résultats des tests publiés indiquaient que le taux d'erreur des mots transcrits finaux était d'environ 2,5 % et que le texte final était donné environ 0,13 seconde après la détection de la fin du discours. La liste comparait 38 modèles à l'époque, testait environ 8 heures d'audio et couvrait trois types de corpus : AA-AgentTalk, VoxPopuli et Earnings22, représentant respectivement 50 %, 25 % et 25 % du poids global. Plus le taux d’erreur sur les mots est faible, mieux c’est. Ce résultat illustre les performances du modèle sur cet ensemble de tests et ne signifie pas que la même précision peut être obtenue dans tous les langages, environnements bruyants et applications du monde réel.

MAI-Transcribe-2-Streaming est actuellement en vente au prix de 0,54 $ par heure d'audio, et l'offre dure jusqu'à fin 2026 ; en comparaison, MAI-Transcribe-2 sans streaming était auparavant annoncé à 0,10 $ de l'heure. La version en temps réel est plus adaptée à une interaction continue, tandis que la version par lots est destinée à l'enregistrement de transcriptions audio. Les prix des deux ne peuvent pas simplement être considérés comme une comparaison directe selon la même méthode d’utilisation.

Le nouveau modèle de synthèse vocale MAI-Voice-2.1 prend en charge 23 langues et 26 variantes régionales, permettant à la même voix synthétisée de basculer entre différentes langues tout en conservant l'identité du locuteur et en adoptant l'accent local de la langue correspondante. Son prix est de 22 dollars américains pour 1 million de caractères. MAI-Voice-2.1-Flash pour les requêtes à faible latence et à grande échelle prend en charge le même langage. Microsoft affirme pouvoir générer 45 secondes d'audio avec un délai de bout en bout d'environ 150 millisecondes. La vitesse d'inférence du modèle est augmentée de 55 % et le prix est environ 60 % inférieur à celui des modèles comparables. Son prix est de 15 $ pour 1 million de caractères. Ce dernier ensemble d'avantages en termes de vitesse et de prix fait partie des comparaisons publiées par Microsoft.

Les deux modèles vocaux prennent en charge le clonage vocal en temps réel dans plusieurs langues, mais uniquement avec l'utilisation de voix de référence autorisées et consenties. La documentation Microsoft répertorie la fonctionnalité comme accès restreint, avec une recommandation audio de référence de 5 à 60 secondes et des protections contre les abus. MAI-Voice-2.1 convient aux contenus plus longs, aux narrations et aux livres audio, tandis que Flash est plus adapté aux scénarios en temps réel tels que les agents vocaux, les assistants et le service client.

Les trois modèles peuvent être utilisés via Microsoft Foundry, MAI Playground et Vercel ; les deux modèles Voice ont également été connectés à OpenRouter et peuvent être appelés via Azure Voice Live. La prise en charge de LiveKit devrait être lancée ultérieurement. La documentation Microsoft Azure qualifie actuellement ces modèles d'aperçu public, indiquant qu'il n'existe aucun accord de niveau de service et qu'ils ne sont pas recommandés pour une utilisation directe dans les charges de travail de production.

En savoir plus :

https://microsoft.ai/news/our-first-streaming-transcription-model/

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire