Les premiers poids du modèle multimodal de DeepSeek-V4 se sont ouverts et « ont ouvert les yeux » pour rattraper l’Opus-4.8

📅 2026-09-01

Résumé :

Après avoir continuellement renforcé les capacités de raisonnement, de code et d'agent, DeepSeek a finalement ajouté une entrée visuelle à la V4. Le matin du 31 août, DeepSeek était dans Hugging Face a ouvert les poids de modèle DeepSeek-V4-Flash-Vision-Exp, et les développeurs peuvent directement télécharger les poids de modèle et les déployer eux-mêmes. En plus des fichiers de modèle, l'entrepôt officiel comprend également des implémentations d'inférence de référence de composants tels que l'encodeur visuel et Aligner, et couvre DFlash. Attention, MoE, Hyper-Connections et DSpark et autres parties.


Il y a à peine 10 jours, DeepSeek a officiellement annoncé le modèle V4-Flash-Vision-Exp, avec une échelle d'environ 305 milliards de paramètres. Il est facile de dire d'après le « Exp » dans le nom qu'il s'agit du premier modèle multimodal expérimental de la série V4. Il est construit sur l'architecture V4-Flash. En ajoutant un module visuel et une formation continue, le modèle gagne en capacité de traiter des images.

En termes de tâches de texte brut, le responsable a déclaré que V4-Flash-Vision-Exp et V4-Flash sont généralement à un niveau similaire. La principale différence est que le nouveau modèle peut reconnaître le contenu des photos, lire le texte des captures d'écran, analyser les graphiques et peut également utiliser des images dans le cadre du flux de travail de l'agent, au lieu de s'appuyer uniquement sur des descriptions textuelles.

Les cas démontrés par DeepSeek incluent la création de PPT selon les exigences, la lecture et la modification de pages Web et la génération de pages frontales avec des effets dynamiques.


Ce que ces tâches ont en commun n'est pas la reconnaissance d'images au sens traditionnel du terme, mais le fait que le modèle doit d'abord comprendre le contenu visuel, puis combiner le code, le raisonnement et les appels d'outils pour effectuer les opérations ultérieures. À en juger par le test de référence publié par DeepSeek, après avoir ajouté des capacités visuelles, la V4 est déjà proche du grand modèle multimodal Anthropic Claude Opus 4.8 qu'elle a choisi pour comparaison dans certaines tâches d'agent multimodal.

Plus précisément, lors du test ApexBench, le score Pass@1 du V4-Flash-Vision-Exp était de 36,5, ce qui était inférieur au 39,4 de l'Opus-4.8. La chartographie est respectivement de 64,3 et 65,0, l'écart est faible. Lors du dernier examen des agents, DeepSeek a obtenu un score de 27,3, supérieur aux 25,7 de l'Opus-4.8. Le score Pass@5 de ZeroBench est de 35,0, ce qui est également supérieur au 34,0 de l'Opus-4.8.


Parmi les quatre données de tests multimodaux, deux dépassaient Opus-4.8

Il convient de noter que le module visuel nouvellement ajouté ne sacrifie pas de manière significative les capacités d'agent de texte d'origine de V4-Flash.

Par exemple, dans Terminal Bench 2.1, la version Vision obtenait un score de 83,9, alors que la version V4-Flash-0731 obtenait auparavant un score de 82,7 ; DeepSWE est passé de 54,4 à 59,3, dépassant le score Opus-4,8 officiellement répertorié de 58,0. Cependant, NL2Repo n’est que de 57,7, ce qui est nettement inférieur aux 69,7 de l’Opus-4.8, et CyberGym est passé de 76,7 à 75,3. Par conséquent, DeepSeek résume ses capacités de texte brut comme étant « à égalité » avec V4-Flash.

D’un autre côté, la capacité visuelle elle-même a des limites. Ce n’est pas un système visuel capable de lire à l’infini les détails haute définition.

Selon la documentation de l'API DeepSeek, le modèle prend en charge les images JPEG, PNG, GIF et WebP et peut recevoir une ou plusieurs images. Cependant, l'image sera mise à l'échelle en fonction de la taille avant d'entrer dans le modèle. Les images plus grandes seront finalement compressées à un volume total de pixels équivalent à environ 800 × 800, et chaque image occupera jusqu'à 384 jetons.

La raison du choix de cette approche est de contrôler le coût de calcul provoqué par la saisie visuelle. Cependant, la mise à l'échelle de l'image peut également constituer une limitation pour les tâches qui reposent spécifiquement sur du texte de petite taille, des textures locales ou une résolution native.

Mais quoi qu’il en soit, DeepSeek a finalement compensé les yeux de la V4.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire