DeepSeek V4 version officielle est arrivée, les nouvelles capacités émergent, le combat pour le roi du rapport qualité-prix est lancé

marsbit2026-07-31 tarihinde yayınlandı2026-07-31 tarihinde güncellendi

Özet

DeepSeek a annoncé le lancement en version bêta publique de l'API DeepSeek-V4-Flash. Malgré une architecture nettement plus légère (284 milliards de paramètres totaux, 13 milliards activés contre 1600/49 pour la version Pro), cette nouvelle version démontre des performances en matière d'Agent (exécution autonome de tâches) qui rivalisent avec celles de la V4-Pro en version préliminaire d'il y a trois mois, selon des tests de référence. L'amélioration clé proviendrait principalement d'un "post-entraînement" avancé et d'optimisations au niveau du cadre d'exécution (Harness), suggérant que la qualité de l'entraînement et les méthodes l'emportent parfois sur la simple augmentation de la taille du modèle. Cette mise à jour stratégique positionne DeepSeek sur le marché en pleine croissance des Agents IA, en proposant une solution à haut rapport performances/coût. Le modèle prend également en charge le format d'API Responses d'OpenAI et est adapté pour des tâches de génération de code, marquant une volonté d'interopérabilité et de concurrence directe sur des terrains établis. Cette annonce intervient peu après un premier tour de table record de plus de 500 milliards de yuans pour DeepSeek, soulignant les attentes fortes quant à sa trajectoire technique et commerciale dans la course à l'IA, où la capacité Agent devient un critère déterminant.

Le 31 juillet en fin d'après-midi, Phoenix Network Technology a constaté en consultant le site officiel de DeepSeek que l'API de la version officielle de DeepSeek-V4-Flash était lancée en bêta publique. Contrairement à la logique hiérarchique précédente "Pro fort, Flash faible", cette mise à jour envoie un signal digne d'attention — les performances de la version officielle Flash sur plusieurs bancs d'essai d'Agent se sont rapprochées, voire dépassées, le niveau de la version préliminaire V4-Pro d'il y a trois mois.

Les notes de mise à jour officielles indiquent que la version officielle V4-Flash a obtenu un score de 82,7 sur Terminal Bench 2.1, 54,2 sur NL2Repo, 76,7 sur Cybergym et 70,3 sur Toolathlon verified. La version préliminaire V4-Pro, quant à elle, avait obtenu un score de 67,9 sur Terminal Bench 2.0.

Il est nécessaire de préciser que Terminal Bench 2.0 et 2.1 ne sont pas le même jeu de tests, une comparaison directe n'est donc pas entièrement équitable. Mais qu'une version légère avec seulement 13 milliards de paramètres activés obtienne de tels scores en termes de capacités d'Agent montre déjà que l'espace d'optimisation dans la phase de post-entraînement pourrait avoir un effet de levier plus important que le simple empilement de paramètres.

De plus, DeepSeek a également spécifié que la bêta publique est actuellement limitée à l'API, et que les applications et la version web ne permettent pas encore d'expérimenter les dernières capacités. La version officielle de DeepSeek-V4-Pro sera publiée dès que possible.

"Seul un post-entraînement a été effectué"

DeepSeek a indiqué dans ses notes de mise à jour : "La structure du modèle, la taille et la version préliminaire de DeepSeek-V4-Flash-0731 restent identiques à celles de DeepSeek-V4-Flash-preview, seul un post-entraînement a été effectué."

Selon le rapport technique officiel de DeepSeek, V4-Flash totalise 284 milliards de paramètres, avec 13 milliards activés ; V4-Pro totalise 1,6 trillion de paramètres, avec 490 milliards activés. Les deux diffèrent d'un ordre de grandeur en termes d'échelle de modèle. Si Flash peut, grâce au post-entraînement, amener ses capacités d'Agent à un niveau proche de celui de Pro, cela signifie que pour des tâches spécifiques, la taille du modèle n'est pas un facteur décisif — le poids des méthodes d'entraînement et de la qualité des données est en hausse.

Les notes officielles spécifient également que pour les tâches d'Agent de code dans les tests de référence publics, le mode minimal de DeepSeek Harness a été utilisé comme cadre de test, avec le niveau max, topp=0,95, temperature=1,0. Ce détail suggère que DeepSeek a probablement effectué des optimisations ciblées au niveau du cadre d'Agent, et pas seulement une amélioration du modèle lui-même.

C'est également la première fois que le Harness développé en interne par DeepSeek apparaît sous un nom officiel. Auparavant, Liang Wenfeng avait comparé la voie vers l'AGI à monter un escalier : le modèle linguistique est la première marche, l'année dernière on a résolu le CoT (Chaîne de Pensée), la marche de cette année est l'Agent, et après l'Agent, le problème à résoudre absolument est l'apprentissage continu — permettre au modèle d'accumuler de l'expérience à long terme comme un humain, plutôt que de devoir être nourri avec un contexte complet à chaque fois pour fonctionner. Ensuite seulement viendront le "point de singularité" de l'auto-itération et l'intelligence incarnée. "L'IA ne manque pas de goût et d'intuition maintenant, elle manque de capacité d'apprentissage continu", a-t-il déclaré. "Les investisseurs regardent l'Agent, nous regardons comment résoudre l'apprentissage."

L'apprentissage continu semble être une problématique au niveau du modèle, mais son point d'ancrage technique se situe précisément dans le Harness. L'équipe Agent Harness de DeepSeek a été formée en mars de cette année, dirigée par Cui Tianyi, né dans les années 90, diplômé en informatique de l'Université du Zhejiang, détenteur de 6 médailles d'or aux compétitions régionales asiatiques de l'ACM, ancien employé pendant neuf ans de la firme quantitative d'élite Jane Street, qui a rejoint DeepSeek en mars de cette année avant de recruter massivement en mai.

Il a été révélé que le plan Harness de DeepSeek sera lancé en même temps que la version officielle de V4. De plus, DeepSeek a indiqué en fin de notes : "La version officielle de DeepSeek-V4-Pro sera publiée dès que possible."

Un affrontement frontal au niveau de l'écosystème

Si la compétition des grands modèles en 2023 était "une bataille de capacités générales", en 2024 c'était "une bataille de contexte long", alors le mot-clé de 2026 est sans aucun doute Agent.

La capacité d'Agent — c'est-à-dire la capacité du modèle à planifier de manière autonome, à utiliser des outils, à exécuter des tâches complexes — est en train de devenir la nouvelle mesure de la puissance d'un grand modèle. Du Terminal Bench (opérations terminal), NL2Repo (génération de dépôts de code) à Cybergym (tâches de cybersécurité), SWE-bench (ingénierie logicielle), une série de tests de référence d'Agent redéfinit ce qu'est un bon modèle.

À l'échelle mondiale, le premier peloton en matière de capacités d'Agent est encore dominé par les géants propriétaires. Selon les données de plateformes d'évaluation tierces comme benchlm.ai, les séries GPT-5.6 Sol et Claude Opus se classent en tête dans la plupart des tests de référence d'Agent. Dans le camp national, GLM, Qwen et autres rattrapent rapidement leur retard.

En augmentant considérablement les capacités d'Agent de Flash cette fois, l'intention stratégique de DeepSeek est claire : pénétrer l'immense marché des applications d'Agent avec un modèle léger à haut rapport qualité-prix.

Après tout, les scénarios d'Agent sont bien plus sensibles à la vitesse d'inférence et au coût que les scénarios de dialogue pur. Une tâche d'Agent nécessitant des appels répétés à des outils et des raisonnements multiples peut coûter plusieurs fois, voire des dizaines de fois plus cher avec un modèle phare qu'avec Flash. Si Flash peut atteindre un niveau "suffisant voire agréable" en capacité d'Agent, son avantage en termes de rapport qualité-prix sera extrêmement puissant.

Les deux jeux de tests internes publiés officiellement sont également très ciblés. DSBench-FullStack (jeu de tests interne de développement full-stack) a obtenu 68,7, DSBench-Hard (jeu de tests interne de problèmes difficiles d'Agent de codage) a obtenu 59,6. Cela confirme indirectement le positionnement de DeepSeek — faire de Flash le socle de choix pour les développeurs et les applications d'Agent.

Une guerre d'écosystème silencieuse est également en train de se déclencher : la version officielle V4-Flash prend en charge nativement le format Responses API et est adaptée spécifiquement pour Codex.

Responses API est le nouveau format d'API poussé par OpenAI. Comparé aux Chat Completions traditionnels, il est plus adapté aux scénarios d'Agent — prenant en charge des appels d'outils plus flexibles, des interactions multi-tours plus complexes et un contrôle de sortie plus fin.

Le support natif de ce format par DeepSeek signifie que les développeurs peuvent migrer leurs applications d'Agent développées sur l'écosystème OpenAI vers DeepSeek à un coût moindre. Ce sera un affrontement frontal entre les deux au niveau de l'écosystème.

L'adaptation à Codex, quant à elle, vise le scénario vertical de la génération de code et du développement logiciel. Codex est le modèle d'OpenAI pour le domaine du code. L'adaptation ciblée de DeepSeek équivaut à lancer un défi directement dans le domaine d'excellence traditionnel d'OpenAI.

Vu ensemble, ces actions montrent que l'ambition de DeepSeek ne se limite pas à être un "remplaçant bon marché", mais bien à établir sa propre niche dans l'ère de l'Agent.

Après le financement de 50 milliards : une fenêtre temporelle sous haute valorisation

Cette mise à jour intervient moins de deux mois après que DeepSeek ait finalisé son premier tour de financement externe.

Il y a environ un mois et demi, DeepSeek a bouclé son premier tour de financement externe depuis sa création il y a près de trois ans, pour un montant total supérieur à 50 milliards de yuans, établissant un record pour l'industrie chinoise de l'IA en matière de tour unique, avec une valorisation post-investissement d'environ 52 milliards de dollars (environ 350 milliards de yuans). Le groupe d'investisseurs comprenait des géants industriels comme Tencent, CATL, JD.com, ainsi que plusieurs fonds industriels d'État.

À la mi-juillet, DeepSeek avait l'intention de procéder à un nouveau tour de financement privé, avec une valorisation pré-investissement d'environ 71 milliards de dollars (environ 480 milliards de yuans), soit une augmentation d'environ 37% par rapport à la valorisation post-premier tour de 52 milliards de dollars. De 52 à 71 milliards, l'intervalle est inférieur à six semaines.

Derrière la haute valorisation se cache la reconnaissance du marché pour la force technique de DeepSeek, ainsi que des paris sur ses perspectives commerciales. Mais une haute valorisation signifie également de grandes attentes et une forte pression.

Selon de nombreux reportages, le fondateur de DeepSeek, Liang Wenfeng, a lui-même contribué environ 20 milliards de yuans lors du premier tour de financement, conservant un contrôle ferme de l'entreprise grâce à une structure spéciale. Ce fondateur issu de la quantification de Phantom Fang, qui avait persisté pendant près de trois ans avec des fonds propres, passe maintenant de "pas de financement, pas d'introduction en bourse" à une adoption active du capital, ce qui en soi est un signal fort — DeepSeek accélère vers la commercialisation et l'IPO.

Le lancement de la version officielle de Flash peut peut-être être considéré comme une matérialisation technique de DeepSeek avec le soutien du capital. Mais le vrai test est encore à venir : la version officielle de Pro arrivera-t-elle à temps ? L'amélioration des capacités d'Agent pourra-t-elle se transformer en revenus tangibles ? Sous la pression conjointe de géants comme OpenAI et Anthropic, comment la voie du haut rapport qualité-prix de DeepSeek exploitera-t-elle ses avantages ?

Le rideau de la guerre de l'Agent vient tout juste de se lever. Avec une évolution significative d'un modèle léger, DeepSeek pose une nouvelle question à l'industrie — lorsque les bénéfices du post-entraînement seront pleinement exploités, lorsque les gains d'efficacité commenceront à compenser l'écart de paramètres, la logique de compétition des grands modèles devra peut-être être réécrite.

Cet article provient du compte WeChat officiel "Phoenix Network Technology", auteur : Phoenix Network Technology

Trend Kriptolar

İlgili Sorular

QQuelle est la principale nouveauté annoncée pour DeepSeek V4-Flash dans cet article ?

AL'API de la version officielle de DeepSeek V4-Flash est lancée en bêta publique. Sa particularité est que ses performances sur plusieurs benchmarks d'Agent se sont rapprochées, voire ont dépassé, le niveau de la version préliminaire de V4-Pro datant de trois mois, et ce malgré des paramètres activés bien inférieurs (130 milliards contre 490 milliards).

QSelon l'article, qu'est-ce que la progression de V4-Flash suggère concernant l'importance de la taille des modèles d'IA ?

ALes progrès de V4-Flash suggèrent que pour des tâches spécifiques (comme les capacités d'Agent), la taille du modèle n'est pas le facteur décisif. L'article indique que les méthodes d'entraînement et la qualité des données (notamment l'optimisation lors de la phase de post-entraînement) prennent plus d'importance, et que les gains d'efficacité peuvent compenser l'écart de paramètres.

QQuel est l'objectif stratégique de DeepSeek en améliorant significativement les capacités d'Agent de son modèle léger V4-Flash ?

AL'objectif stratégique est de pénétrer le vaste marché des applications d'Agent avec un modèle léger et à haut rapport performance/prix. Les scénarios d'Agent étant très sensibles à la vitesse d'inférence et au coût, si V4-Flash offre des capacités 'suffisantes voire excellentes', son avantage en termes de coût pourrait être décisif pour attirer les développeurs et devenir la base de prédilection pour les applications d'Agent.

QQuel développement technique interne, mentionné pour la première fois officiellement, est évoqué comme ayant potentiellement contribué aux performances ?

AIl s'agit de 'DeepSeek Harness', un framework d'Agent développé en interne. Son équipe a été formée en mars et il est utilisé ici en mode 'minimaliste' pour les tests des tâches d'Agent. L'article suggère que des optimisations au niveau du framework Harness, et pas seulement du modèle lui-même, pourraient avoir joué un rôle dans l'amélioration des performances.

QComment l'article interprète-t-il le timing de cette mise à jour, peu après le premier tour de financement externe de DeepSeek ?

AL'article interprète le lancement de la version officielle de V4-Flash comme une première 'matérialisation technique' suite à l'injection de capitaux. Cela montre l'accélération de DeepSeek vers la commercialisation et une éventuelle introduction en bourse. La forte valorisation (520 milliards de dollars après le premier tour) crée cependant des attentes et une pression élevées pour transformer les avancées techniques en revenus réels.

İlgili Okumalar

Goldman Sachs: July Smashes Through Crowded Trades, U.S. Stock Bull Market Not Broken but Harder to Navigate

Goldman Sachs: July Sees Crowded Trades Unwound, U.S. Bull Market Intact but Getting Tougher. The U.S. stock market in July did not see an index-level crash, but rather a significant unwinding of speculative positions. While the S&P 500 remained stable—trading within a narrow 3.5% range and staying within 2% of its high—underlying market dynamics were volatile. Heavily crowded trades, particularly in high-momentum tech, AI-linked stocks, and Asian strategies, faced severe pressure and forced deleveraging. Data indicates this was a meaningful cleanse, not a minor adjustment. Global tech exposure saw its largest sell-off in over five years, leverage in Korean equity ETFs plummeted, and Goldman's prime brokerage recorded the largest gross exposure reduction since late 2022. Leverage on momentum factors among fundamental long/short clients fell to the 28th percentile of its one-year range. The AI trade narrative shifted from pure potential to a focus on tangible returns. While Meta failed to show clear AI monetization, Microsoft and Amazon provided evidence that massive capital expenditure is translating into scalable revenue and product growth, preventing a blanket sell-off of the AI sector. The Federal Reserve's more opaque communication style and volatility in long-end Treasury yields have introduced new friction, particularly for rate-sensitive growth and tech stocks. The broader outlook for U.S. equities remains favorable, supported by a strong economy, robust earnings, and substantial AI capital expenditure. However, risk/reward is no longer cheap, and the market's upward elasticity has weakened. The Nasdaq 100's trajectory—up 12% year-to-date despite significant pullbacks—illustrates that the bull trend persists but the path is becoming more difficult. The key lesson from July is that the market no longer rewards crowded, highly leveraged trades, requiring more disciplined and liquid portfolio approaches.

marsbit2 saat önce

Goldman Sachs: July Smashes Through Crowded Trades, U.S. Stock Bull Market Not Broken but Harder to Navigate

marsbit2 saat önce

Interview with Robinhood Executive: Meme + Tokenized US Stocks as "Barbell" Customer Acquisition Strategy, All Business Lines Achieve Hundreds of Millions in Revenue

Interview with Robinhood executive Johann Kerbrat reveals the company's "barbell" customer acquisition strategy for its new Robinhood Chain, combining meme tokens with tokenized stocks. Three weeks after mainnet launch, the chain has seen over $3B in weekly DEX volume and 105M transactions. Kerbrat explains the logic behind the permissionless chain: meme tokens attract DeFi users, while tokenized real-world assets (RWA), currently over 90 US stocks and ETFs accessible in 120+ countries, serve global users. The goal is to bring Robinhood's 27 million funded accounts on-chain by simplifying DeFi with a user-friendly interface, exemplified by features like Robinhood Earn which offers yield without requiring wallet management. Built on Arbitrum's technology stack for its speed, low cost, and Ethereum's security, the chain focuses on financial products like Earn, spot trading, and perpetuals. Kerbrat downplays direct competition with platforms like Base, emphasizing the goal of expanding the overall market for on-chain assets. He details selective partnerships (e.g., Morpho, Lighter) based on compliance, unique UX, and differentiation. While regulatory clarity is pending for US perpetuals, the expansion continues via Bitstamp in Europe. Finally, Kerbrat positions Robinhood as a "super app" integrating stocks, options, crypto, banking, and AI trading, with all major business lines generating hundreds of millions in revenue. For the chain, current priority is driving adoption over maximizing gas fee revenue.

marsbit4 saat önce

Interview with Robinhood Executive: Meme + Tokenized US Stocks as "Barbell" Customer Acquisition Strategy, All Business Lines Achieve Hundreds of Millions in Revenue

marsbit4 saat önce

İşlemler

Spot

Popüler Makaleler

T Nasıl Satın Alınır

HTX.com’a hoş geldiniz! Threshold Network Token (T) satın alma işlemlerini basit ve kullanışlı bir hâle getirdik. Adım adım açıkladığımız rehberimizi takip ederek kripto yolculuğunuza başlayın. 1. Adım: HTX Hesabınızı OluşturunHTX'te ücretsiz bir hesap açmak için e-posta adresinizi veya telefon numaranızı kullanın. Sorunsuzca kaydolun ve tüm özelliklerin kilidini açın. Hesabımı Aç2. Adım: Kripto Satın Al Bölümüne Gidin ve Ödeme Yönteminizi SeçinKredi/Banka Kartı: Visa veya Mastercard'ınızı kullanarak anında Threshold Network Token (T) satın alın.Bakiye: Sorunsuz bir şekilde işlem yapmak için HTX hesap bakiyenizdeki fonları kullanın.Üçüncü Taraflar: Kullanımı kolaylaştırmak için Google Pay ve Apple Pay gibi popüler ödeme yöntemlerini ekledik.P2P: HTX'teki diğer kullanıcılarla doğrudan işlem yapın.Borsa Dışı (OTC): Yatırımcılar için kişiye özel hizmetler ve rekabetçi döviz kurları sunuyoruz.3. Adım: Threshold Network Token (T) Varlıklarınızı SaklayınThreshold Network Token (T) satın aldıktan sonra HTX hesabınızda saklayın. Alternatif olarak, blok zinciri transferi yoluyla başka bir yere gönderebilir veya diğer kripto para birimlerini takas etmek için kullanabilirsiniz.4. Adım: Threshold Network Token (T) Varlıklarınızla İşlem YapınHTX'in spot piyasasında Threshold Network Token (T) ile kolayca işlemler yapın.Hesabınıza erişin, işlem çiftinizi seçin, işlemlerinizi gerçekleştirin ve gerçek zamanlı olarak izleyin. Hem yeni başlayanlar hem de deneyimli yatırımcılar için kullanıcı dostu bir deneyim sunuyoruz.

674 Toplam GörüntülenmeYayınlanma 2024.12.10Güncellenme 2026.06.02

T Nasıl Satın Alınır

Tartışmalar

HTX Topluluğuna hoş geldiniz. Burada, en son platform gelişmeleri hakkında bilgi sahibi olabilir ve profesyonel piyasa görüşlerine erişebilirsiniz. Kullanıcıların T (T) fiyatı hakkındaki görüşleri aşağıda sunulmaktadır.

活动图片