La société d’intelligence artificielle d’entreprise Cohere a publié jeudi son premier modèle vocal Transcribe. Il s'agit d'un modèle open source de reconnaissance vocale automatique (ASR), principalement destiné à l'enregistrement parole-texte, à l'analyse du contenu vocal et à d'autres scénarios. La taille des paramètres du modèle est d'environ 2 milliards et se positionne comme une solution « légère », facile à exécuter sur des GPU grand public et adaptée au déploiement par les entreprises et les développeurs ayant des exigences d'auto-hébergement.

Transcribe prend actuellement en charge 14 langues, dont l'anglais, le français, l'allemand, l'italien, l'espagnol, le portugais, le grec, le néerlandais, le polonais, le chinois, le japonais, le coréen, le vietnamien et l'arabe. Cohere a déclaré que sur la liste Open ASR de Hugging Face, Transcribe a atteint un taux d'erreur de mot (WER) moyen de 5,42, surpassant des modèles tels que Zoom Scribe v1, IBM Granite 4.0 1B, ElevenLabs Scribe v2 et Qwen3-ASR-1.7B Speech dans ce benchmark.

En termes d'évaluation humaine, Cohere a déclaré que lorsque les évaluateurs humains comparaient les résultats de transcription en termes d'exactitude, de cohérence et de convivialité, Transcribe avait un taux de réussite moyen de 61 % par rapport aux autres modèles. Cependant, la société a également admis que les performances du modèle sont encore légèrement inférieures à celles de certains produits concurrents dans des langues telles que le portugais, l'allemand et l'espagnol.

En termes de performances, les données fournies par Cohere indiquent que Transcribe peut traiter environ 525 minutes d'audio par minute, ce qui est un niveau élevé parmi des modèles similaires. Cohere prévoit d'intégrer ce modèle vocal dans North, sa plateforme d'orchestration d'agents pour les entreprises, et de le rendre librement accessible via l'API de l'entreprise. Dans le même temps, Transcribe sera également répertorié sur la plateforme d'inférence hébergée de Cohere, Model Vault, permettant aux clients de l'appeler directement.

Les modèles de reconnaissance vocale dans leur ensemble se réchauffent rapidement à mesure que la demande d'applications de prise de notes vocales et de dictée telles que Granola et Wispr Flow continue de croître. Dans ce contexte, Cohere tente d'entrer sur le marché grâce à un support open source, léger et multilingue, en fournissant une infrastructure vocale auto-hébergée et conviviale aux entreprises qui souhaitent contrôler leurs données et leur environnement de déploiement.

Plus tôt cette année, il a été annoncé que Cohere réaliserait environ 240 millions de dollars de revenus récurrents annuels (ARR) en 2025, et le PDG de la société, Aidan Gomez, aurait déclaré que la startup pourrait devenir publique « probablement bientôt ».