Résumé :
Depuis la sortie officielle jusqu'au moment où il a été remplacé par Flash, DeepSeek n'a laissé que 32 jours pour la version officielle de V4 Pro.
Le 10 septembre, DeepSeek a publié la V4.1 Flash et a annoncé qu'à partir de midi le 14 septembre, heure de Pékin, toutes les demandes envoyées à V4 Pro dans l'API officielle seront prises en charge par Flash et facturées à un prix Flash inférieur. Cet arrangement se poursuivra jusqu'au lancement de la V4.1 Pro.

V4 Pro sera disponible en version préliminaire à partir du 24 avril et sera officiellement lancé le 13 août.
Moins d'un mois après le lancement de la version officielle, l'entreprise a déjà décidé de son « heure de sortie ».
Ce qui mérite d'être demandé, c'est pourquoi DeepSeek n'a-t-il pas réduit le prix du Pro et ne l'a-t-il pas conservé, ou simplement attendu que la prochaine génération de Pro soit prête, puis laissé les deux prendre le relais normalement ?
Mon avis est que la V4 Pro a encore des atouts, mais elle ne vaut plus l'investissement continu de DeepSeek dans la puissance de calcul à elle seule.
L'adoption de Flash V4.1, qui rend l'architecture plus efficace et a surpassé de nombreux tests d'agents intelligents, peut non seulement réduire les dépenses d'exploitation de l'entreprise, mais également réduire les factures des utilisateurs.01 Flash a rattrapé la direction sur laquelle Pro s'était concentré le mois dernier
Il y a un mois, la version officielle de V4 Pro était lancée. Son orientation principale est très claire : agents intelligents, programmation de code et invocation d’outils. DeepSeek a ouvert différentes intensités d'inférence à cette époque et a également spécialement adapté le Codex, dans l'espoir qu'il puisse prendre en charge un travail plus complexe et plus long.

Mais quelque chose s'est mal passé le jour où la version officielle a été mise en ligne : la notification du site officiel et l'annonce de la plateforme ouverte ont été supprimées pendant un certain temps et ont été restaurées cette nuit-là. Pendant cette période, l’entrée des appels API a toujours été conservée. Selon les médias, certains développeurs ont également signalé que le temps de réflexion du modèle était trop court, que les tâches longues se terminaient prématurément et que les résultats pouvaient être très différents si la même question était exécutée quelques heures plus tard.
L'augmentation des prix qui a suivi a élevé le niveau de réalisation. À partir du 17 août, le prix de production de Pro pendant les heures de pointe est passé de 6 yuans à 27 yuans par million de jetons, soit 4,5 fois le prix initial.
Pour les développeurs qui sentent déjà que leurs performances sont instables, il est difficile de dire que cette dépense supplémentaire a été échangée contre des améliorations correspondantes.
Maintenant, le nouveau Flash vient de rattraper son retard dans ces directions clés.
Les données officielles montrent que dans le test d'ingénierie logicielle DeepSWE v1.1 et le test de bureautique AutomationBench, Flash a obtenu respectivement 74,2 points et 54,8 points, nettement devant les 62,7 points et 43,2 points de V4Pro.
Ce que le nouveau modèle gagne, c'est précisément la tâche pour laquelle Pro a été promu le mois dernier.

Pro ne perd pas à chaque tour. Dans le sous-ensemble de texte brut HLE qui n'appelle pas d'outils, il est toujours en tête de Flash avec 42,7 points et 39,1 points ; mais dans le test HLE complet qui permet l'utilisation d'outils, Flash a obtenu 63,9 points, soit 60 points de plus que Pro. De plus, dans la comparaison des modèles de base avant post-formation, Pro conserve toujours la tête des questions et réponses de connaissances SimpleQA-Verified et des tests de texte long LongBench-V2.
Par conséquent, le « dépassement global » mentionné dans l’annonce officielle de DeepSeek ne peut pas simplement être compris comme une victoire dans chaque sous-catégorie.
Il y a encore des choses que le Pro fait bien, et il reste précieux pour les utilisateurs qui ont besoin de ces capacités spécifiques. Ce qui est vraiment ébranlé, c'est le positionnement commercial original du produit phare.Dans le passé, les développeurs et les entreprises comprenaient facilement la division entre les deux modèles : Flash était choisi si le budget était limité, et les tâches complexes et longues étaient laissées au Pro, plus cher. Maintenant que Flash a dépassé de nombreux tests de smartphones grand public, il est difficile pour Pro de convaincre le marché avec l'étiquette de « plus cher, mais généralement plus solide ».
Une large avance suffit pour soutenir un produit phare à prix élevé destiné au grand public ; mais si elle ne domine que certaines tâches segmentées, l'entreprise doit recalculer : combien de personnes ne peuvent pas se passer de ces capacités, combien de primes elles sont prêtes à payer pour cela et s'il vaut la peine d'allouer des clusters de puissance de calcul pour les prendre en charge.
Les informations publiques ne fournissent pas encore de comptes spécifiques sur les coûts et les utilisateurs. Mais à en juger par les actions produit de DeepSeek, celui-ci a visiblement renoncé à l'idée de conserver un équipement indépendant et exclusif pour l'ancien Pro.
02 Réduisez le prix de Pro et économisez sur le coût de son fonctionnement
Si le problème est simplement que Flash est bon marché, Pro peut naturellement suivre la promotion de réduction de prix. La difficulté est que les baisses de prix ne peuvent modifier que les chiffres figurant sur la facture, mais pas la consommation physique qui sous-tend le modèle.
Selon les données divulguées par la carte modèle officielle, le nombre de paramètres activés par chaque jeton du V4 Pro s'élève à 49 milliards. V4.1Flash dissocie le traitement des entrées de la génération de réponses, activant respectivement seulement 8 milliards et 16 milliards de paramètres. Bien que le rapport des paramètres ne puisse pas être directement assimilé à la réduction des coûts, l’échelle de calcul requise pour chaque inférence directe entre les deux est complètement différente du même ordre de grandeur.
La nouvelle architecture réduit également considérablement la surcharge de stockage des tâches contextuelles longues. Par rapport au Flash V4, le cache KV global occupé par le Flash V4.1 a été réduit à environ un quart, et l'espace SSD occupé par le cache KV persistant a été réduit à environ un huitième. L'exécution de l'agent nécessite de lire à plusieurs reprises le code de contexte, les documents de référence et les données renvoyées par des outils externes. Le cache est spécialement utilisé pour stocker l'état historique calculé par le grand modèle.
Une fois le cycle de tâche allongé et le degré de concurrence accru, la mémoire de stockage atteint rapidement son niveau le plus bas. Ce que Flash doit résoudre n'est pas seulement de répondre correctement à une question, mais aussi de réduire la pression sur les ressources lorsque des tâches simultanées massives s'exécutent en même temps.

DeepSeek a directement mentionné dans l'annonce qu'une efficacité architecturale plus élevée permet à l'entreprise de proposer davantage de simultanéité à moindre coût. Il est donc logique de baisser le prix.
Au 11 septembre, calculé sur la base d'un million de jetons à Gushi, le prix d'entrée du cache manqué V4 Pro est de 4,5 yuans et le prix de sortie est de 13,5 yuans ; les prix Flash V4.1 correspondants ne sont que de 1 yuan et 4 yuans (les prix maximaux des deux modèles sont le double de ceux de Gushi). Avec la mise en œuvre du commutateur, les frais de l'interface Pro, initialement coûteuse, seront directement réduits au niveau de Flash.
Bien que la différence de prix entre les deux ne soit pas équivalente au coût matériel réel de DeepSeek, la stratégie est très claire : utiliser une nouvelle architecture très efficace pour accepter pleinement les demandes d'anciennes interfaces, puis transférer les coûts matériels économisés sur le marché.
Si vous réduisez le prix de Pro, la plateforme devra toujours supporter seule les lourds coûts d'inférence et de maintenance ; le passage à Flash aura la possibilité de réduire en même temps les factures des utilisateurs et la charge du serveur.
Après que le grand mannequin ait terminé sa formation, le gouffre sans fond de l'argent n'a pas été fermé. Chaque fois qu'il répond à un appel, il occupe des ressources informatiques en temps réel, et l'exploitation et la maintenance ne peuvent pas s'arrêter un instant.
"Je viens de dépenser beaucoup d'argent pour m'entraîner" ne peut pas être une médaille d'or sans mort pour garder l'ancien Pro. Les coûts irrécupérables sont devenus une réalité, et le maintien de l’ancien modèle nécessite une consommation continue d’argent réel.
Même si l'ancien Pro peut continuer à gagner de l'argent, il est évidemment plus rentable d'utiliser la même puissance de calcul matérielle pour exécuter un nouveau modèle avec une efficacité plus élevée.03 La livraison de 160 000 puces Ascend pourrait prendre plus d'un an
En combinaison avec les récentes actions clés de DeepSeek, nous pouvons mieux comprendre le sentiment d'urgence derrière ce transfert de ressources.
En août de cette année, DeepSeek a lancé une tarification flottante de pointe et de vallée pour guider les tâches de traitement par lots en temps différé à exécuter pendant les périodes d'inactivité.
Il s'agit essentiellement d'extraire toute la puissance de calcul existante de la planification interne lorsque le matériel externe est limité.
L'acquisition de matériel informatique progresse également, mais l'eau venue de loin ne peut étancher la soif de proximité. Bloomberg a rapporté le 4 septembre, citant des personnes proches du dossier, que DeepSeek prévoyait de déployer au moins 160 000 puces Huawei Ascend 950DT dans des centres de données en Mongolie intérieure, qui sont actuellement principalement prévues pour l'inférence de modèles plutôt que pour la formation. Cependant, le rapport mentionne également que la capacité de production de Huawei doit prendre en charge plusieurs clients et qu'en raison des goulots d'étranglement de la chaîne d'approvisionnement, l'ensemble du cycle de livraison des commandes peut prendre plus d'un an.

Le financement DeepSeek s'accélère également. Reuters a rapporté le 9 septembre, citant des personnes proches du dossier, que DeepSeek avait embauché CITIC Securities pour promouvoir le processus d'introduction en bourse du Conseil de l'innovation scientifique et technologique. La collecte de fonds vise principalement à combler le déficit de financement pour l'infrastructure informatique, la recherche et le développement de modèles de pointe et le recrutement des meilleurs talents. Cependant, le calendrier de cotation, le montant de la levée de fonds et l'objectif de valorisation n'ont pas encore été finalisés, et ni DeepSeek ni CITIC Securities n'ont fait de commentaires à ce sujet.

En rassemblant ces pièces du puzzle, nous obtenons une start-up qui souhaite une expansion rapide mais qui est toujours contrainte par les limites des ressources physiques.
L'achat de matériel extérieur et la recherche de financement pour une introduction en bourse résolvent le problème de l'augmentation des ressources à long terme ; tout en recherchant l'efficacité de l'architecture des algorithmes, il s'agit de permettre à la puissance de calcul existante de résister à un pic d'appels plus important.
Le premier nécessite un long cycle de livraison et une opération en capital, tandis que le second peut libérer immédiatement des capacités dans les entreprises existantes à condition que la technologie arrive à maturité.Avec des contraintes de ressources aussi strictes, il est possible de continuer à entretenir l'ancien produit phare, mais le rapport prix/performance est extrêmement faible.
Alors que les modèles plus légers et moins chers sont déjà capables d'effectuer la plupart des tâches essentielles, les quelques avantages uniques laissés par l'ancien Pro sont vraiment difficiles à convaincre l'équipe de continuer à allouer de précieux clusters pour le prendre en charge.Le fondateur Liang Wenfeng avait déjà clairement exprimé ce compromis lors de ses communications avec les investisseurs. Il place clairement l'exploration AGI à long terme au-dessus de la maximisation des profits à court terme, estime que le modèle open source et la commercialisation sont totalement cohérents et déclare sans ambages que la puissance de calcul est le principal goulot d'étranglement de l'expansion commerciale actuelle.
En regardant ce « changement de modèle flash » de ce point de vue, je préfère une explication stratégique : l'objectif de DeepSeek est de pousser l'échelle des services existants à l'extrême le plus rapidement possible tout en promouvant la prochaine génération d'exploration des frontières.
Maintenant que les nouvelles technologies ont complètement restructuré les courbes de coût et de performances de la puissance de calcul, la matrice des produits doit être vigoureusement réorganisée. Il n’est pas nécessaire d’imposer une longue période de protection premium pour les produits phares de la génération précédente.04 DeepSeek n'attend pas le prochain Pro
La caractéristique la plus frappante de ce remplacement est son caractère décisif : DeepSeek n'a même pas attendu que la V4.1 Pro prenne forme.
Selon la pratique des logiciels commerciaux conventionnels, il peut conserver complètement le canal indépendant de l'ancien Pro pour apaiser les entreprises clientes qui comptent sur l'ancien modèle, et en même temps lancer Flash en remplacement déclassé ; attendez que la prochaine génération Pro soit complètement mature, puis terminez l'itération étape par étape, étape par étape, pour donner à la gamme de produits une apparence lisse et bien rangée.

Mais DeepSeek a annoncé un autre arrangement : l'ancien Flash sera repris par Flash V4.1, et le trafic API de l'ancien Pro sera également fusionné de force dans Flash après le 14 septembre. Bien que le nom de l'interface d'origine soit conservé et que la facturation soit directement réduite, le noyau du modèle sous-jacent a été complètement remplacé.
Le responsable a encore évoqué la future V4.1 Pro, mais ils ne l'ont pas attendu et continuent de conserver la position de l'ancienne Pro.
DeepSeek est prêt à laisser sa nouvelle technologie éliminer d’abord son ancien produit phare. Le montant des investissements en recherche et développement et le fait qu’il ne soit en ligne que depuis un mois ne sont pas devenus une raison pour le protéger.Cependant, ce n'est pas parce que le nom de l'interface reste inchangé que les développeurs peuvent se reposer et se détendre.
De nombreuses entreprises ont déjà affiné le framework Prompt, les paramètres système et les liens d'appel d'outils en plusieurs étapes autour de l'ancien Pro, et devront très probablement réexécuter des tests de régression sur le nouveau modèle.
Si l'exécution de certaines tâches qui reposent fortement sur le raisonnement en texte long ou en texte brut Pro décline, les appels de la communauté et des entreprises clientes à conserver l'ancien canal ont également une rationalité pratique.Cela pose un problème pour la nouvelle génération Pro qui n'a pas encore été dévoilé : s'il veut à nouveau fournir des services indépendants à un prix plus élevé, il doit proposer des fonctionnalités difficiles à réaliser avec Flash et qui valent le paiement supplémentaire pour les utilisateurs, pas seulement meilleures que l'ancien Pro.
Commentaires