Le 31 juillet en fin d'après-midi, Phoenix Network Technology a constaté en consultant le site officiel de DeepSeek que l'API de la version officielle de DeepSeek-V4-Flash était lancée en bêta publique. Contrairement à la logique hiérarchique précédente "Pro fort, Flash faible", cette mise à jour envoie un signal digne d'attention — les performances de la version officielle Flash sur plusieurs bancs d'essai d'Agent se sont rapprochées, voire dépassées, le niveau de la version préliminaire V4-Pro d'il y a trois mois.

Les notes de mise à jour officielles indiquent que la version officielle V4-Flash a obtenu un score de 82,7 sur Terminal Bench 2.1, 54,2 sur NL2Repo, 76,7 sur Cybergym et 70,3 sur Toolathlon verified. La version préliminaire V4-Pro, quant à elle, avait obtenu un score de 67,9 sur Terminal Bench 2.0.

Il est nécessaire de préciser que Terminal Bench 2.0 et 2.1 ne sont pas le même jeu de tests, une comparaison directe n'est donc pas entièrement équitable. Mais qu'une version légère avec seulement 13 milliards de paramètres activés obtienne de tels scores en termes de capacités d'Agent montre déjà que l'espace d'optimisation dans la phase de post-entraînement pourrait avoir un effet de levier plus important que le simple empilement de paramètres.
De plus, DeepSeek a également spécifié que la bêta publique est actuellement limitée à l'API, et que les applications et la version web ne permettent pas encore d'expérimenter les dernières capacités. La version officielle de DeepSeek-V4-Pro sera publiée dès que possible.
"Seul un post-entraînement a été effectué"
DeepSeek a indiqué dans ses notes de mise à jour : "La structure du modèle, la taille et la version préliminaire de DeepSeek-V4-Flash-0731 restent identiques à celles de DeepSeek-V4-Flash-preview, seul un post-entraînement a été effectué."
Selon le rapport technique officiel de DeepSeek, V4-Flash totalise 284 milliards de paramètres, avec 13 milliards activés ; V4-Pro totalise 1,6 trillion de paramètres, avec 490 milliards activés. Les deux diffèrent d'un ordre de grandeur en termes d'échelle de modèle. Si Flash peut, grâce au post-entraînement, amener ses capacités d'Agent à un niveau proche de celui de Pro, cela signifie que pour des tâches spécifiques, la taille du modèle n'est pas un facteur décisif — le poids des méthodes d'entraînement et de la qualité des données est en hausse.
Les notes officielles spécifient également que pour les tâches d'Agent de code dans les tests de référence publics, le mode minimal de DeepSeek Harness a été utilisé comme cadre de test, avec le niveau max, topp=0,95, temperature=1,0. Ce détail suggère que DeepSeek a probablement effectué des optimisations ciblées au niveau du cadre d'Agent, et pas seulement une amélioration du modèle lui-même.
C'est également la première fois que le Harness développé en interne par DeepSeek apparaît sous un nom officiel. Auparavant, Liang Wenfeng avait comparé la voie vers l'AGI à monter un escalier : le modèle linguistique est la première marche, l'année dernière on a résolu le CoT (Chaîne de Pensée), la marche de cette année est l'Agent, et après l'Agent, le problème à résoudre absolument est l'apprentissage continu — permettre au modèle d'accumuler de l'expérience à long terme comme un humain, plutôt que de devoir être nourri avec un contexte complet à chaque fois pour fonctionner. Ensuite seulement viendront le "point de singularité" de l'auto-itération et l'intelligence incarnée. "L'IA ne manque pas de goût et d'intuition maintenant, elle manque de capacité d'apprentissage continu", a-t-il déclaré. "Les investisseurs regardent l'Agent, nous regardons comment résoudre l'apprentissage."
L'apprentissage continu semble être une problématique au niveau du modèle, mais son point d'ancrage technique se situe précisément dans le Harness. L'équipe Agent Harness de DeepSeek a été formée en mars de cette année, dirigée par Cui Tianyi, né dans les années 90, diplômé en informatique de l'Université du Zhejiang, détenteur de 6 médailles d'or aux compétitions régionales asiatiques de l'ACM, ancien employé pendant neuf ans de la firme quantitative d'élite Jane Street, qui a rejoint DeepSeek en mars de cette année avant de recruter massivement en mai.
Il a été révélé que le plan Harness de DeepSeek sera lancé en même temps que la version officielle de V4. De plus, DeepSeek a indiqué en fin de notes : "La version officielle de DeepSeek-V4-Pro sera publiée dès que possible."
Un affrontement frontal au niveau de l'écosystème
Si la compétition des grands modèles en 2023 était "une bataille de capacités générales", en 2024 c'était "une bataille de contexte long", alors le mot-clé de 2026 est sans aucun doute Agent.
La capacité d'Agent — c'est-à-dire la capacité du modèle à planifier de manière autonome, à utiliser des outils, à exécuter des tâches complexes — est en train de devenir la nouvelle mesure de la puissance d'un grand modèle. Du Terminal Bench (opérations terminal), NL2Repo (génération de dépôts de code) à Cybergym (tâches de cybersécurité), SWE-bench (ingénierie logicielle), une série de tests de référence d'Agent redéfinit ce qu'est un bon modèle.
À l'échelle mondiale, le premier peloton en matière de capacités d'Agent est encore dominé par les géants propriétaires. Selon les données de plateformes d'évaluation tierces comme benchlm.ai, les séries GPT-5.6 Sol et Claude Opus se classent en tête dans la plupart des tests de référence d'Agent. Dans le camp national, GLM, Qwen et autres rattrapent rapidement leur retard.
En augmentant considérablement les capacités d'Agent de Flash cette fois, l'intention stratégique de DeepSeek est claire : pénétrer l'immense marché des applications d'Agent avec un modèle léger à haut rapport qualité-prix.
Après tout, les scénarios d'Agent sont bien plus sensibles à la vitesse d'inférence et au coût que les scénarios de dialogue pur. Une tâche d'Agent nécessitant des appels répétés à des outils et des raisonnements multiples peut coûter plusieurs fois, voire des dizaines de fois plus cher avec un modèle phare qu'avec Flash. Si Flash peut atteindre un niveau "suffisant voire agréable" en capacité d'Agent, son avantage en termes de rapport qualité-prix sera extrêmement puissant.
Les deux jeux de tests internes publiés officiellement sont également très ciblés. DSBench-FullStack (jeu de tests interne de développement full-stack) a obtenu 68,7, DSBench-Hard (jeu de tests interne de problèmes difficiles d'Agent de codage) a obtenu 59,6. Cela confirme indirectement le positionnement de DeepSeek — faire de Flash le socle de choix pour les développeurs et les applications d'Agent.
Une guerre d'écosystème silencieuse est également en train de se déclencher : la version officielle V4-Flash prend en charge nativement le format Responses API et est adaptée spécifiquement pour Codex.
Responses API est le nouveau format d'API poussé par OpenAI. Comparé aux Chat Completions traditionnels, il est plus adapté aux scénarios d'Agent — prenant en charge des appels d'outils plus flexibles, des interactions multi-tours plus complexes et un contrôle de sortie plus fin.
Le support natif de ce format par DeepSeek signifie que les développeurs peuvent migrer leurs applications d'Agent développées sur l'écosystème OpenAI vers DeepSeek à un coût moindre. Ce sera un affrontement frontal entre les deux au niveau de l'écosystème.
L'adaptation à Codex, quant à elle, vise le scénario vertical de la génération de code et du développement logiciel. Codex est le modèle d'OpenAI pour le domaine du code. L'adaptation ciblée de DeepSeek équivaut à lancer un défi directement dans le domaine d'excellence traditionnel d'OpenAI.
Vu ensemble, ces actions montrent que l'ambition de DeepSeek ne se limite pas à être un "remplaçant bon marché", mais bien à établir sa propre niche dans l'ère de l'Agent.
Après le financement de 50 milliards : une fenêtre temporelle sous haute valorisation
Cette mise à jour intervient moins de deux mois après que DeepSeek ait finalisé son premier tour de financement externe.
Il y a environ un mois et demi, DeepSeek a bouclé son premier tour de financement externe depuis sa création il y a près de trois ans, pour un montant total supérieur à 50 milliards de yuans, établissant un record pour l'industrie chinoise de l'IA en matière de tour unique, avec une valorisation post-investissement d'environ 52 milliards de dollars (environ 350 milliards de yuans). Le groupe d'investisseurs comprenait des géants industriels comme Tencent, CATL, JD.com, ainsi que plusieurs fonds industriels d'État.

À la mi-juillet, DeepSeek avait l'intention de procéder à un nouveau tour de financement privé, avec une valorisation pré-investissement d'environ 71 milliards de dollars (environ 480 milliards de yuans), soit une augmentation d'environ 37% par rapport à la valorisation post-premier tour de 52 milliards de dollars. De 52 à 71 milliards, l'intervalle est inférieur à six semaines.
Derrière la haute valorisation se cache la reconnaissance du marché pour la force technique de DeepSeek, ainsi que des paris sur ses perspectives commerciales. Mais une haute valorisation signifie également de grandes attentes et une forte pression.
Selon de nombreux reportages, le fondateur de DeepSeek, Liang Wenfeng, a lui-même contribué environ 20 milliards de yuans lors du premier tour de financement, conservant un contrôle ferme de l'entreprise grâce à une structure spéciale. Ce fondateur issu de la quantification de Phantom Fang, qui avait persisté pendant près de trois ans avec des fonds propres, passe maintenant de "pas de financement, pas d'introduction en bourse" à une adoption active du capital, ce qui en soi est un signal fort — DeepSeek accélère vers la commercialisation et l'IPO.
Le lancement de la version officielle de Flash peut peut-être être considéré comme une matérialisation technique de DeepSeek avec le soutien du capital. Mais le vrai test est encore à venir : la version officielle de Pro arrivera-t-elle à temps ? L'amélioration des capacités d'Agent pourra-t-elle se transformer en revenus tangibles ? Sous la pression conjointe de géants comme OpenAI et Anthropic, comment la voie du haut rapport qualité-prix de DeepSeek exploitera-t-elle ses avantages ?
Le rideau de la guerre de l'Agent vient tout juste de se lever. Avec une évolution significative d'un modèle léger, DeepSeek pose une nouvelle question à l'industrie — lorsque les bénéfices du post-entraînement seront pleinement exploités, lorsque les gains d'efficacité commenceront à compenser l'écart de paramètres, la logique de compétition des grands modèles devra peut-être être réécrite.
Cet article provient du compte WeChat officiel "Phoenix Network Technology", auteur : Phoenix Network Technology






