Alibaba lance Qwen3.8-Omni-Flash, avec de multiples performances proches de Gemini 3.8 Flash

📅 2026-09-18

Résumé :

L'équipe Qwen d'Alibaba a récemment publié une nouvelle génération de modèle natif entièrement modal Qwen3.8-Omni-Flash, qui combine davantage la compréhension audio et vidéo avec les capacités d'agent IA.

Le modèle prend en charge quatre formulaires de saisie : texte, image, audio et vidéo, et fournit une fenêtre contextuelle de 1 million de jetons. Par rapport à la génération précédente Qwen3.5-Omni-Plus, les responsables de Qwen affirment que son score moyen dans 29 tests de référence a augmenté de plus de 25 %, tout en réduisant considérablement les coûts de traitement audio et vidéo.

1789705181_banner-latest.en.webp

L'un des changements les plus importants apportés à Qwen3.8-Omni-Flash est qu'il ne se contente pas de combiner la reconnaissance vocale, la reconnaissance d'images et d'autres fonctionnalités, mais qu'il traite de manière native différents types d'informations à partir du niveau du modèle. Alibaba espère utiliser cela pour permettre au modèle non seulement de « comprendre » ou de « comprendre » le contenu audio et vidéo, mais aussi de planifier davantage les tâches, d'appeler des outils et d'effectuer le travail réel après avoir compris ces informations.

En termes de capacités audio, les performances du Qwen3.8-Omni-Flash sont particulièrement remarquables. Selon les données publiées par Qwen, ce modèle a surpassé le Gemini 3.8 Flash dans certains tests de référence audio. Par exemple, dans le test d'appel à l'outil multimodal WildClawBench-MM, Qwen3.8-Omni-Flash a obtenu 71,0 points, tandis que Gemini 3.8 Flash a obtenu 58,9 points ; dans le test DailyOmni, Qwen a marqué 85,1 points et Gemini 84,0 points ; dans SpotSoundBench, les deux ont marqué respectivement 67,2 points et 39,7 points ; au test MMAU, ils ont obtenu 81,8 points et 76,9 points.

La reconnaissance vocale des conférences multi-intervenants est également au centre de cette mise à niveau. Les données de test AliMeeting publiées par Qwen montrent que le taux d'erreur du locuteur DER du Qwen3.8-Omni-Flash est de 3,35 et le taux d'erreur des mots cpWER avec attribution du locuteur est de 17,18, tandis que le Qwen3.5-Omni-Plus de la génération précédente est respectivement de 88,11 et 89,61. Cela signifie que le nouveau modèle change considérablement dans ce test.

Cependant, Qwen3.8-Omni-Flash n'est pas en avance sur Gemini 3.8 Flash dans tous les projets. Par exemple, dans le test AgenticVBench, Gemini 3.8 Flash a obtenu 45,0 points et Qwen 36,8 points ; dans OmniGAIA, ils ont marqué respectivement 78,6 et 74,0 points. Dans certains tests de compréhension vidéo, Gemini a également conservé son avantage. Par conséquent, l'accent mis par Qwen sur « l'approche de Gemini » se reflète davantage dans les capacités globales audio et audio et vidéo, et ne signifie pas une avance globale dans tous les projets multimodaux.

Un autre changement important dans Qwen3.8-Omni-Flash est le prix. Qwen affirme que son coût horaire estimé pour l'entrée audio a chuté de plus de 98 % et que le coût horaire pour l'entrée audio et vidéo a chuté de plus de 93 % par rapport au modèle précédent. Selon la méthode de calcul officielle, le coût dit « horaire » est calculé en multipliant le prix de traitement de deux minutes de matériel par 30, dans lequel la vidéo adopte la condition d'entrée de 720p et 1 image par seconde.

Le prix régional international actuel annoncé par Alibaba Cloud est de 0,15 USD par million de jetons entrés, le jeton d'entrée arrivant dans le cache est de 0,016 USD et le jeton de sortie par million est de 0,47 USD. Les prix en Chine continentale et dans certaines autres régions varient. Étant donné que l'audio et la vidéo peuvent être utilisés directement comme entrées de modèle, cette structure tarifaire est particulièrement adaptée à des scénarios tels que l'enregistrement de réunions, l'analyse audio longue, la révision vidéo, la génération de sous-titres et le traitement de grandes quantités de contenu multimédia.

La fenêtre contextuelle d'un million de jetons amplifie encore cet avantage. La longueur d'entrée maximale de Qwen3.8-Omni-Flash est proche de 992 000 jetons, la longueur d'entrée maximale en mode réflexion est d'environ 984 000 jetons et la longueur de sortie maximale atteint 131 000 jetons. Cela signifie que les développeurs peuvent directement transmettre du contenu audio ou vidéo à très grande échelle au modèle pour traitement, sans avoir à découper et extraire fréquemment des images comme par le passé, puis utiliser plusieurs modèles pour compléter respectivement la reconnaissance vocale, la compréhension visuelle et le raisonnement textuel.

Les informations officielles d'Alibaba Cloud montrent que Qwen3.8-Omni-Flash peut gérer l'entrée audio dans 113 langues et dialectes et prend en charge l'analyse audio spatiale. Grâce à des paramètres pertinents, le modèle peut gérer l'audio stéréo à deux canaux et l'audio spatial à quatre canaux. Dans le même temps, le modèle prend en charge l'appel de fonctions, la recherche sur le réseau, la mise en cache contextuelle et d'autres fonctionnalités, et peut être directement utilisé dans des flux de travail d'agent plus complexes.

Du point de vue de l'orientation des applications, l'équipe Qwen se concentre cette fois sur la « livraison intelligente ». Par exemple, le modèle peut analyser de longues vidéos, localiser le contenu clé et appeler d'autres outils pour effectuer des tâches telles que le montage vidéo, l'organisation du contenu, le résumé de la réunion et la génération de sous-titres. Qwen a également annoncé Qwen-MM-Plugins pour le développement d'agents multimodaux et prévoit de lancer Qwen-Live-Harness pour aider les développeurs à créer davantage d'applications d'agents intelligentes basées sur les entrées audio et vidéo.

Par rapport à la génération précédente Qwen3.5-Omni, l'objectif de cette mise à niveau n'est pas seulement d'améliorer la précision de la reconnaissance au sens traditionnel du terme, mais d'essayer de changer la façon dont l'IA audio et vidéo est utilisée. Dans le passé, les applications multimodales nécessitaient généralement d'extraire des images vidéo et de transcrire l'audio, puis de transmettre les différents résultats au modèle de langage pour traitement ; Qwen3.8-Omni-Flash essaie d'unifier autant que possible ces liens dans un modèle natif entièrement modal et utilise 1 million de contextes de jetons pour traiter directement le contenu original plus long.

Qwen3.8-Omni-Flash fournit actuellement des services via Alibaba Cloud Bailian, prenant en charge des régions telles que Pékin, Singapour, Hong Kong, Chine, Tokyo, Japon, Francfort, Allemagne et Virginie, États-Unis. Le modèle lui-même n'ouvre pas directement les poids comme certains modèles précédents de Qwen. Alibaba ouvre cette fois principalement les plug-ins multimodaux de support et les outils de développement associés.

Dans l'ensemble, l'objectif principal de cette mise à jour Qwen3.8-Omni-Flash n'est pas seulement d'améliorer les scores d'exécution des modèles, mais également de réduire simultanément les coûts de traitement des basses vidéo, d'élargir l'échelle de contexte et de combiner la compréhension audio et vidéo avec l'invocation d'outils. En particulier, le coût de l'entrée audio a été réduit de plus de 98 %. Si le coût d'utilisation réel peut atteindre le niveau de calcul officiel, cela facilitera l'analyse automatique à grande échelle des enregistrements de réunions à long terme, des podcasts, des diffusions en direct et du matériel vidéo, et intensifiera encore la concurrence entre Qwen et les modèles multimodaux tels que Google Gemini.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire