Résumé
Google a récemment publié Gemini 3.5 Transcribe, le dernier modèle de conversion parole-texte de la série Gemini, le qualifiant de modèle de reconnaissance vocale le plus précis de la série. Ce modèle est ouvert aux développeurs, aux entreprises et aux utilisateurs ordinaires et se concentre sur l'amélioration des capacités de translittération dans les environnements bruyants, les termes professionnels complexes et les expressions orales naturelles.

Selon les rapports, Gemini 3.5 Transcribe peut mieux gérer le bruit de fond et le vocabulaire complexe dans les domaines professionnels. Google a déclaré que le nouveau modèle a apporté des améliorations de performances à l'application Gemini sur la plate-forme macOS et à la fonction Rambler du clavier Gboard sur la plate-forme Android. Les développeurs peuvent utiliser ce modèle pour créer des applications telles que des agents vocaux, des outils de sous-titres en temps réel et des processus d'analyse post-appel.
Google a déclaré que Gemini 3.5 Transcribe est conçu pour capturer les modèles de parole naturels des utilisateurs afin de comprendre plus précisément l'intention sémantique, d'identifier le vocabulaire personnalisé et d'aider les utilisateurs à effectuer des tâches par la voix.
Au niveau fonctionnel, le nouveau modèle ajoute un certain nombre de capacités d'optimisation, notamment l'autocorrection automatique, la suppression des mots de remplissage prononcés tels que « um » et « ah », et le formatage automatique du texte de sortie. Dans le même temps, il peut également déléguer des tâches plus complexes telles que l'analyse de fichiers et la génération d'images à d'autres modèles Gemini pour former une expérience de collaboration multimodèle plus complète.
En termes de précision, Google a souligné que le taux d'erreur moyen sur les mots de Gemini 3.5 Transcribe est de 4,0 % dans les scénarios de reconnaissance vocale en streaming, et peut être réduit à 2,6 % dans les scénarios sans streaming. Le modèle offre de meilleures performances de transcription dans des environnements bruyants et peut identifier plus précisément les informations clés composées de lettres et de chiffres, telles que les numéros de commande et les codes postaux.

En termes de prise en charge linguistique, Gemini 3.5 Transcribe couvre actuellement 85 langues et prend en charge les accents régionaux et différents dialectes. Pour l'audio préenregistré, il peut effectuer une reconnaissance d'attribution vocale horodatée pour jusqu'à trois locuteurs ; en outre, le modèle peut s'adapter aux vocabulaires définis par l'utilisateur pour identifier les termes professionnels, les orthographes spéciales et les noms d'industrie.
Gemini 3.5 Transcribe est actuellement disponible en préversion publique via l'API Gemini dans Google AI Studio et Google Antigravity. Les utilisateurs ordinaires peuvent bénéficier de fonctions associées sur les plateformes Android et macOS. Google prévoit également de l'introduire dans le navigateur Chrome, où les utilisateurs peuvent saisir du texte directement par la voix dans la zone de saisie de n'importe quelle page Web.
Récemment, Google a continué à accélérer le développement de la gamme de produits Gemini. La société a précédemment lancé Gemini 3.7 Flash pour rejoindre la concurrence de plus en plus féroce sur les prix des modèles d'IA ; Gemini dans Chrome pour Android a également été ouvert à tous les utilisateurs aux États-Unis, et Gemini Assistant est également entré dans la nouvelle génération de taxis autonomes de Waymo.
Commentaires