DeepSeek V4 version officielle est arrivée, les nouvelles capacités émergent, le combat pour le roi du rapport qualité-prix est lancé

marsbitОпубліковано о 2026-07-31Востаннє оновлено о 2026-07-31

Анотація

DeepSeek a annoncé le lancement en version bêta publique de l'API DeepSeek-V4-Flash. Malgré une architecture nettement plus légère (284 milliards de paramètres totaux, 13 milliards activés contre 1600/49 pour la version Pro), cette nouvelle version démontre des performances en matière d'Agent (exécution autonome de tâches) qui rivalisent avec celles de la V4-Pro en version préliminaire d'il y a trois mois, selon des tests de référence. L'amélioration clé proviendrait principalement d'un "post-entraînement" avancé et d'optimisations au niveau du cadre d'exécution (Harness), suggérant que la qualité de l'entraînement et les méthodes l'emportent parfois sur la simple augmentation de la taille du modèle. Cette mise à jour stratégique positionne DeepSeek sur le marché en pleine croissance des Agents IA, en proposant une solution à haut rapport performances/coût. Le modèle prend également en charge le format d'API Responses d'OpenAI et est adapté pour des tâches de génération de code, marquant une volonté d'interopérabilité et de concurrence directe sur des terrains établis. Cette annonce intervient peu après un premier tour de table record de plus de 500 milliards de yuans pour DeepSeek, soulignant les attentes fortes quant à sa trajectoire technique et commerciale dans la course à l'IA, où la capacité Agent devient un critère déterminant.

Le 31 juillet en fin d'après-midi, Phoenix Network Technology a constaté en consultant le site officiel de DeepSeek que l'API de la version officielle de DeepSeek-V4-Flash était lancée en bêta publique. Contrairement à la logique hiérarchique précédente "Pro fort, Flash faible", cette mise à jour envoie un signal digne d'attention — les performances de la version officielle Flash sur plusieurs bancs d'essai d'Agent se sont rapprochées, voire dépassées, le niveau de la version préliminaire V4-Pro d'il y a trois mois.

Les notes de mise à jour officielles indiquent que la version officielle V4-Flash a obtenu un score de 82,7 sur Terminal Bench 2.1, 54,2 sur NL2Repo, 76,7 sur Cybergym et 70,3 sur Toolathlon verified. La version préliminaire V4-Pro, quant à elle, avait obtenu un score de 67,9 sur Terminal Bench 2.0.

Il est nécessaire de préciser que Terminal Bench 2.0 et 2.1 ne sont pas le même jeu de tests, une comparaison directe n'est donc pas entièrement équitable. Mais qu'une version légère avec seulement 13 milliards de paramètres activés obtienne de tels scores en termes de capacités d'Agent montre déjà que l'espace d'optimisation dans la phase de post-entraînement pourrait avoir un effet de levier plus important que le simple empilement de paramètres.

De plus, DeepSeek a également spécifié que la bêta publique est actuellement limitée à l'API, et que les applications et la version web ne permettent pas encore d'expérimenter les dernières capacités. La version officielle de DeepSeek-V4-Pro sera publiée dès que possible.

"Seul un post-entraînement a été effectué"

DeepSeek a indiqué dans ses notes de mise à jour : "La structure du modèle, la taille et la version préliminaire de DeepSeek-V4-Flash-0731 restent identiques à celles de DeepSeek-V4-Flash-preview, seul un post-entraînement a été effectué."

Selon le rapport technique officiel de DeepSeek, V4-Flash totalise 284 milliards de paramètres, avec 13 milliards activés ; V4-Pro totalise 1,6 trillion de paramètres, avec 490 milliards activés. Les deux diffèrent d'un ordre de grandeur en termes d'échelle de modèle. Si Flash peut, grâce au post-entraînement, amener ses capacités d'Agent à un niveau proche de celui de Pro, cela signifie que pour des tâches spécifiques, la taille du modèle n'est pas un facteur décisif — le poids des méthodes d'entraînement et de la qualité des données est en hausse.

Les notes officielles spécifient également que pour les tâches d'Agent de code dans les tests de référence publics, le mode minimal de DeepSeek Harness a été utilisé comme cadre de test, avec le niveau max, topp=0,95, temperature=1,0. Ce détail suggère que DeepSeek a probablement effectué des optimisations ciblées au niveau du cadre d'Agent, et pas seulement une amélioration du modèle lui-même.

C'est également la première fois que le Harness développé en interne par DeepSeek apparaît sous un nom officiel. Auparavant, Liang Wenfeng avait comparé la voie vers l'AGI à monter un escalier : le modèle linguistique est la première marche, l'année dernière on a résolu le CoT (Chaîne de Pensée), la marche de cette année est l'Agent, et après l'Agent, le problème à résoudre absolument est l'apprentissage continu — permettre au modèle d'accumuler de l'expérience à long terme comme un humain, plutôt que de devoir être nourri avec un contexte complet à chaque fois pour fonctionner. Ensuite seulement viendront le "point de singularité" de l'auto-itération et l'intelligence incarnée. "L'IA ne manque pas de goût et d'intuition maintenant, elle manque de capacité d'apprentissage continu", a-t-il déclaré. "Les investisseurs regardent l'Agent, nous regardons comment résoudre l'apprentissage."

L'apprentissage continu semble être une problématique au niveau du modèle, mais son point d'ancrage technique se situe précisément dans le Harness. L'équipe Agent Harness de DeepSeek a été formée en mars de cette année, dirigée par Cui Tianyi, né dans les années 90, diplômé en informatique de l'Université du Zhejiang, détenteur de 6 médailles d'or aux compétitions régionales asiatiques de l'ACM, ancien employé pendant neuf ans de la firme quantitative d'élite Jane Street, qui a rejoint DeepSeek en mars de cette année avant de recruter massivement en mai.

Il a été révélé que le plan Harness de DeepSeek sera lancé en même temps que la version officielle de V4. De plus, DeepSeek a indiqué en fin de notes : "La version officielle de DeepSeek-V4-Pro sera publiée dès que possible."

Un affrontement frontal au niveau de l'écosystème

Si la compétition des grands modèles en 2023 était "une bataille de capacités générales", en 2024 c'était "une bataille de contexte long", alors le mot-clé de 2026 est sans aucun doute Agent.

La capacité d'Agent — c'est-à-dire la capacité du modèle à planifier de manière autonome, à utiliser des outils, à exécuter des tâches complexes — est en train de devenir la nouvelle mesure de la puissance d'un grand modèle. Du Terminal Bench (opérations terminal), NL2Repo (génération de dépôts de code) à Cybergym (tâches de cybersécurité), SWE-bench (ingénierie logicielle), une série de tests de référence d'Agent redéfinit ce qu'est un bon modèle.

À l'échelle mondiale, le premier peloton en matière de capacités d'Agent est encore dominé par les géants propriétaires. Selon les données de plateformes d'évaluation tierces comme benchlm.ai, les séries GPT-5.6 Sol et Claude Opus se classent en tête dans la plupart des tests de référence d'Agent. Dans le camp national, GLM, Qwen et autres rattrapent rapidement leur retard.

En augmentant considérablement les capacités d'Agent de Flash cette fois, l'intention stratégique de DeepSeek est claire : pénétrer l'immense marché des applications d'Agent avec un modèle léger à haut rapport qualité-prix.

Après tout, les scénarios d'Agent sont bien plus sensibles à la vitesse d'inférence et au coût que les scénarios de dialogue pur. Une tâche d'Agent nécessitant des appels répétés à des outils et des raisonnements multiples peut coûter plusieurs fois, voire des dizaines de fois plus cher avec un modèle phare qu'avec Flash. Si Flash peut atteindre un niveau "suffisant voire agréable" en capacité d'Agent, son avantage en termes de rapport qualité-prix sera extrêmement puissant.

Les deux jeux de tests internes publiés officiellement sont également très ciblés. DSBench-FullStack (jeu de tests interne de développement full-stack) a obtenu 68,7, DSBench-Hard (jeu de tests interne de problèmes difficiles d'Agent de codage) a obtenu 59,6. Cela confirme indirectement le positionnement de DeepSeek — faire de Flash le socle de choix pour les développeurs et les applications d'Agent.

Une guerre d'écosystème silencieuse est également en train de se déclencher : la version officielle V4-Flash prend en charge nativement le format Responses API et est adaptée spécifiquement pour Codex.

Responses API est le nouveau format d'API poussé par OpenAI. Comparé aux Chat Completions traditionnels, il est plus adapté aux scénarios d'Agent — prenant en charge des appels d'outils plus flexibles, des interactions multi-tours plus complexes et un contrôle de sortie plus fin.

Le support natif de ce format par DeepSeek signifie que les développeurs peuvent migrer leurs applications d'Agent développées sur l'écosystème OpenAI vers DeepSeek à un coût moindre. Ce sera un affrontement frontal entre les deux au niveau de l'écosystème.

L'adaptation à Codex, quant à elle, vise le scénario vertical de la génération de code et du développement logiciel. Codex est le modèle d'OpenAI pour le domaine du code. L'adaptation ciblée de DeepSeek équivaut à lancer un défi directement dans le domaine d'excellence traditionnel d'OpenAI.

Vu ensemble, ces actions montrent que l'ambition de DeepSeek ne se limite pas à être un "remplaçant bon marché", mais bien à établir sa propre niche dans l'ère de l'Agent.

Après le financement de 50 milliards : une fenêtre temporelle sous haute valorisation

Cette mise à jour intervient moins de deux mois après que DeepSeek ait finalisé son premier tour de financement externe.

Il y a environ un mois et demi, DeepSeek a bouclé son premier tour de financement externe depuis sa création il y a près de trois ans, pour un montant total supérieur à 50 milliards de yuans, établissant un record pour l'industrie chinoise de l'IA en matière de tour unique, avec une valorisation post-investissement d'environ 52 milliards de dollars (environ 350 milliards de yuans). Le groupe d'investisseurs comprenait des géants industriels comme Tencent, CATL, JD.com, ainsi que plusieurs fonds industriels d'État.

À la mi-juillet, DeepSeek avait l'intention de procéder à un nouveau tour de financement privé, avec une valorisation pré-investissement d'environ 71 milliards de dollars (environ 480 milliards de yuans), soit une augmentation d'environ 37% par rapport à la valorisation post-premier tour de 52 milliards de dollars. De 52 à 71 milliards, l'intervalle est inférieur à six semaines.

Derrière la haute valorisation se cache la reconnaissance du marché pour la force technique de DeepSeek, ainsi que des paris sur ses perspectives commerciales. Mais une haute valorisation signifie également de grandes attentes et une forte pression.

Selon de nombreux reportages, le fondateur de DeepSeek, Liang Wenfeng, a lui-même contribué environ 20 milliards de yuans lors du premier tour de financement, conservant un contrôle ferme de l'entreprise grâce à une structure spéciale. Ce fondateur issu de la quantification de Phantom Fang, qui avait persisté pendant près de trois ans avec des fonds propres, passe maintenant de "pas de financement, pas d'introduction en bourse" à une adoption active du capital, ce qui en soi est un signal fort — DeepSeek accélère vers la commercialisation et l'IPO.

Le lancement de la version officielle de Flash peut peut-être être considéré comme une matérialisation technique de DeepSeek avec le soutien du capital. Mais le vrai test est encore à venir : la version officielle de Pro arrivera-t-elle à temps ? L'amélioration des capacités d'Agent pourra-t-elle se transformer en revenus tangibles ? Sous la pression conjointe de géants comme OpenAI et Anthropic, comment la voie du haut rapport qualité-prix de DeepSeek exploitera-t-elle ses avantages ?

Le rideau de la guerre de l'Agent vient tout juste de se lever. Avec une évolution significative d'un modèle léger, DeepSeek pose une nouvelle question à l'industrie — lorsque les bénéfices du post-entraînement seront pleinement exploités, lorsque les gains d'efficacité commenceront à compenser l'écart de paramètres, la logique de compétition des grands modèles devra peut-être être réécrite.

Cet article provient du compte WeChat officiel "Phoenix Network Technology", auteur : Phoenix Network Technology

Трендові криптовалюти

Пов'язані питання

QQuelle est la principale nouveauté annoncée pour DeepSeek V4-Flash dans cet article ?

AL'API de la version officielle de DeepSeek V4-Flash est lancée en bêta publique. Sa particularité est que ses performances sur plusieurs benchmarks d'Agent se sont rapprochées, voire ont dépassé, le niveau de la version préliminaire de V4-Pro datant de trois mois, et ce malgré des paramètres activés bien inférieurs (130 milliards contre 490 milliards).

QSelon l'article, qu'est-ce que la progression de V4-Flash suggère concernant l'importance de la taille des modèles d'IA ?

ALes progrès de V4-Flash suggèrent que pour des tâches spécifiques (comme les capacités d'Agent), la taille du modèle n'est pas le facteur décisif. L'article indique que les méthodes d'entraînement et la qualité des données (notamment l'optimisation lors de la phase de post-entraînement) prennent plus d'importance, et que les gains d'efficacité peuvent compenser l'écart de paramètres.

QQuel est l'objectif stratégique de DeepSeek en améliorant significativement les capacités d'Agent de son modèle léger V4-Flash ?

AL'objectif stratégique est de pénétrer le vaste marché des applications d'Agent avec un modèle léger et à haut rapport performance/prix. Les scénarios d'Agent étant très sensibles à la vitesse d'inférence et au coût, si V4-Flash offre des capacités 'suffisantes voire excellentes', son avantage en termes de coût pourrait être décisif pour attirer les développeurs et devenir la base de prédilection pour les applications d'Agent.

QQuel développement technique interne, mentionné pour la première fois officiellement, est évoqué comme ayant potentiellement contribué aux performances ?

AIl s'agit de 'DeepSeek Harness', un framework d'Agent développé en interne. Son équipe a été formée en mars et il est utilisé ici en mode 'minimaliste' pour les tests des tâches d'Agent. L'article suggère que des optimisations au niveau du framework Harness, et pas seulement du modèle lui-même, pourraient avoir joué un rôle dans l'amélioration des performances.

QComment l'article interprète-t-il le timing de cette mise à jour, peu après le premier tour de financement externe de DeepSeek ?

AL'article interprète le lancement de la version officielle de V4-Flash comme une première 'matérialisation technique' suite à l'injection de capitaux. Cela montre l'accélération de DeepSeek vers la commercialisation et une éventuelle introduction en bourse. La forte valorisation (520 milliards de dollars après le premier tour) crée cependant des attentes et une pression élevées pour transformer les avancées techniques en revenus réels.

Пов'язані матеріали

Thanks to Dice Rolls, Bitcoin Keys Are Stored Offline, But Not Everyone Will Do It

The article discusses using dice rolls to generate secure Bitcoin wallet seeds, providing entropy independent of potentially flawed hardware random number generators. It explains that each fair dice roll offers about 2.585 bits of entropy, with around 50 rolls needed for a standard 12-word seed phrase and 99+ recommended for higher security. This method gained attention after a vulnerability was revealed in some Coldcard hardware wallets, where a faulty firmware RNG (dating back to 2021) compromised generated keys. The analysis notes that while a dice-generated main seed was safe from this specific flaw, other Coldcard functions (like creating paper wallets, backup keys, or passwords) could still be vulnerable if they used the defective RNG. The piece argues that while dice-based entropy is technically robust, the manual process is error-prone, tedious, and unrealistic for most new users, who might make mistakes in recording or inputting rolls. It concludes that while manual entropy generation should remain an option for advanced users, the long-term goal is to develop reliable, user-friendly hardware and software that securely generates randomness without requiring specialized knowledge. Coldcard users are advised to check their firmware version and replace any secondary secrets (like paper wallet keys) created with vulnerable devices, while also considering multi-signature setups with devices from different manufacturers for added security.

cryptonews.ru36 хв тому

Thanks to Dice Rolls, Bitcoin Keys Are Stored Offline, But Not Everyone Will Do It

cryptonews.ru36 хв тому

Торгівля

Спот

Популярні статті

Як купити T

Ласкаво просимо до HTX.com! Ми зробили покупку Threshold Network Token (T) простою та зручною. Дотримуйтесь нашої покрокової інструкції, щоб розпочати свою криптовалютну подорож.Крок 1: Створіть обліковий запис на HTXВикористовуйте свою електронну пошту або номер телефону, щоб зареєструвати обліковий запис на HTX безплатно. Пройдіть безпроблемну реєстрацію й отримайте доступ до всіх функцій.ЗареєструватисьКрок 2: Перейдіть до розділу Купити крипту і виберіть спосіб оплатиКредитна/дебетова картка: використовуйте вашу картку Visa або Mastercard, щоб миттєво купити Threshold Network Token (T).Баланс: використовуйте кошти з балансу вашого рахунку HTX для безперешкодної торгівлі.Треті особи: ми додали популярні способи оплати, такі як Google Pay та Apple Pay, щоб підвищити зручність.P2P: Торгуйте безпосередньо з іншими користувачами на HTX.Позабіржова торгівля (OTC): ми пропонуємо індивідуальні послуги та конкурентні обмінні курси для трейдерів.Крок 3: Зберігайте свої Threshold Network Token (T)Після придбання Threshold Network Token (T) збережіть його у своєму обліковому записі на HTX. Крім того, ви можете відправити його в інше місце за допомогою блокчейн-переказу або використовувати його для торгівлі іншими криптовалютами.Крок 4: Торгівля Threshold Network Token (T)Легко торгуйте Threshold Network Token (T) на спотовому ринку HTX. Просто увійдіть до свого облікового запису, виберіть торгову пару, укладайте угоди та спостерігайте за ними в режимі реального часу. Ми пропонуємо зручний досвід як для початківців, так і для досвідчених трейдерів.

557 переглядів усьогоОпубліковано 2024.12.10Оновлено 2026.06.02

Як купити T

Обговорення

Ласкаво просимо до спільноти HTX. Тут ви можете бути в курсі останніх подій розвитку платформи та отримати доступ до професійної ринкової інформації. Нижче представлені думки користувачів щодо ціни T (T).

活动图片