Le projet DeepSeek le plus prometteur fait son apparition : tout peut être un plugin. Harness ne cherche pas à imiter qui que ce soit, mais à confier le pouvoir de définition à la communauté open source.
Le soir du 13 août,
DeepSeek
a finalement pris la parole et diffusé deux informations importantes. La première est la sortie de la version officielle de
DeepSeek
V4 Pro, mise à jour simultanément sur l'application, le site web et l'API. Les utilisateurs peuvent sélectionner le "Mode Expert" dans l'application ou sur le site web pour utiliser le nouveau modèle officiel V4 Pro. Le nom du modèle dans l'API reste inchangé.
La seconde est que l'équipe "
DeepSeek
Harness", reconnaissable à son avatar de baleine noire, a publié son premier message, annonçant la mise en ligne de la version développeur de prévisualisation de Harness, publiée en open source sous licence MIT.
Comme annoncé précédemment, la version officielle de V4 Pro et le Harness autodéveloppé par l'équipe ont été présentés simultanément. Comme nous avions déjà présenté V4 Pro de manière détaillée, cet article se concentrera sur l'analyse de l'intérêt de
DeepSeek
Harness.
Et après cette journée,
DeepSeek
ne risque-t-il pas de passer d'une société de modèles à une entreprise plus difficile à définir.
01
Un même modèle, un changement d'enveloppe qui le transforme
Pour comprendre pourquoi Harness est important, il faut d'abord comprendre un fait contre-intuitif : à l'ère des agents, ce n'est pas seulement le modèle qui détermine si une IA peut travailler.
Les 6 et 11 août, la société d'outils pour agents intelligents Composio a mené deux séries de tests expérimentaux pour tenter de démontrer la valeur de Harness. Les chercheurs ont connecté le même modèle
DeepSeek
V4-Flash à huit Harness différents, c'est-à-dire des systèmes d'exécution englobant le modèle, et leur ont demandé d'effectuer respectivement trente tâches en plusieurs étapes. Ces tâches n'étaient pas des questions-réponses, mais exigeaient que l'agent accède à des applications réelles comme Gmail, Google Calendar, GitHub, Slack, etc., appelle des outils et modifie l'état de l'application. Chaque tâche pouvait durer jusqu'à quinze minutes et était considérée comme réussie uniquement si tous les contrôles étaient passés.

Les résultats montrent des écarts notables. Le Pi Agent, le plus performant, a réussi vingt tâches, tandis que l'OpenCode, le moins performant, n'en a réussi que quatorze. Sur les huit Harness exécutant un total de deux cent quarante tâches, seulement cent vingt-neuf ont abouti. Parmi les trente tâches, seules six ont été accomplies par tous les Harness. En termes de coût, pour accomplir seize tâches avec succès, les coûts estimés par tâche réussie pour Claude Code, Codex et DeepAgents étaient respectivement d'environ 0,195 $, 0,081 $ et 0,045 $. Pour un même modèle, une différence de plus de quatre fois.

Cela signifie que le modèle fixe la limite supérieure des capacités, tandis que le Harness détermine finalement dans quelle mesure cette limite peut être réalisée et à quel coût. Pour une longue tâche, le système d'exécution doit constamment prendre des décisions : quoi garder ou jeter dans le contexte, quand appeler quel outil, en cas d'erreur de l'outil, faut-il réessayer ou changer de voie, si le modèle dit avoir terminé, faut-il le croire ou vérifier à nouveau. Une mauvaise gestion à n'importe quelle étape peut faire échouer la tâche, même si le raisonnement du modèle était correct, au moment de modifier réellement le fichier ou de soumettre le code.
Il est à noter qu'il s'agit de l'un des rares projets DeepSeek à avoir été ouvert au test interne en avance.
Plusieurs développeurs ont obtenu un accès en bêta à Harness avant sa sortie. Certains tests internes ont révélé qu'en faisant exécuter le même V4-Flash sur
DeepSeek
Harness, Reasonix et Codex pour accomplir le même jeu, les résultats étaient radicalement différents. Cela montre que lorsque le modèle est identique, les outils, les invites, l'organisation du contexte et les stratégies d'exécution fournis par le système d'exécution peuvent changer significativement le résultat final.
C'est précisément la raison pour laquelle
DeepSeek
attache de l'importance à son Harness autodéveloppé. En interne, DeepSeek considérait que l'agent devait résoudre le problème de l'apprentissage continu, pour finalement permettre à l'IA d'accélérer la R&D en IA. En suivant cette ligne de pensée, Harness n'est pas un outil de programmation externe, mais un poste de travail permettant au modèle de s'engager dans des tâches de R&D réelles.
De plus, pour une entreprise qui s'appuie sur les prix bas et les capacités de ses modèles, si la livraison des tâches, les retours d'échec et l'accès aux développeurs restent longtemps dépendants des systèmes d'autrui, même avec des avantages de prix, elle ne peut décider combien de tokens une tâche va réellement consommer, combien de tentatives seront nécessaires, et quand la tâche sera réellement considérée comme terminée.
02
Tout est plugin, DeepSeek ne cherche pas à remplacer qui que ce soit
Qu'est-ce que Harness exactement ? La description la plus simple sur le marché est "la version DeepSeek de Claude Code". Mais ceux qui ont utilisé la version bêta s'accordent généralement à dire que cette définition n'est pas précise.
Selon la documentation officielle de
DeepSeek
, la philosophie de conception de Harness est "Everything is a plugin" — tout est un plugin. Il est construit sur le système de plugins Cordis. Le modèle, les outils, les compétences, les sessions, le bac à sable, le stockage, les boucles, la planification, l'interface utilisateur — toutes les capacités de l'agent sont constituées par une combinaison de plugins. Les développeurs peuvent sélectionner, remplacer ou étendre n'importe quelle capacité via la configuration, sans modifier le code source de Harness.

Cela n'est pas du même ordre que les plugins habituels. Les plugins de VS Code ajoutent des fonctionnalités à l'éditeur, ceux de Codex ajoutent des outils à l'agent. Mais les plugins de Harness peuvent remplacer le cerveau de l'agent, la boîte à outils, les règles, voire l'ensemble de l'interface.
Selon plusieurs sources ayant participé aux tests internes, les développeurs se sont éclatés avec les plugins pendant cette période. "Les gens n'ont plus vraiment testé, ils se sont mis à écrire des plugins", et en quelques jours seulement, des centaines de plugins sont apparus — certains ont carrément modifié toute l'interface de travail, d'autres ont implémenté "une mémoire à long terme inter-sessions avec une évolution autonome en arrière-plan" en utilisant uniquement des plugins, permettant au modèle de revoir périodiquement ses propres enregistrements de travail et de compresser les expériences temporaires en connaissances durables.
D'autres ont également noté que la gouvernance de la communauté open source pourrait également devenir un défi pour
DeepSeek
.
Une autre conception clé est la traçabilité. Harness utilise un journal de session en "append-only". Tout ce que le modèle voit — les invites système, la chaîne de pensée, les appels d'outils et leurs résultats, la planification des sous-agents, chaque injection de contexte — est intégralement enregistré. La compression du contexte ne supprime pas l'historique original ; elle modifie simplement la représentation que le modèle voit par la suite en remplaçant des événements. Les développeurs peuvent remonter à la source dans la vue "Trajectory", avec prise en charge de la restauration, de la duplication, de la recherche et de la relecture. La documentation officielle résume ce principe par "Ce qui est visible pour le modèle est enregistré".
Cela reflète une pensée typique d'ingénierie système. Selon les rapports, le responsable de l'équipe
DeepSeek
Harness, Cui Tianyi, est diplômé du département d'informatique de l'Université du Zhejiang. Il a travaillé pendant neuf ans chez Jane Street, une société de trading quantitatif, avant de rejoindre
DeepSeek
en mars 2026. Le projet Harness a été lancé en interne en mai. Le principal avantage concurrentiel des systèmes de trading haute fréquence quantitatif n'a jamais été la finesse des stratégies, mais l'exécution stable dans des environnements extrêmement complexes, la gestion des exceptions, la traçabilité complète des logs et le contrôle des risques — c'est précisément la pièce manquante pour faire passer l'agent IA de la démonstration à la production. Un développeur bêta-testeur l'a décrit comme "stable comme un roc" lors de l'exécution de longues tâches : si une tâche est interrompue, elle est automatiquement sauvegardée et peut reprendre plus tard sans recommencer depuis le début.
Il est important de noter que Harness ne s'est pas enfermé dans le jardin clos des modèles
DeepSeek
. Il prend en charge par défaut près de quarante grands modèles, notamment
Kimi
, OpenAI, Anthropic, Google, etc. Alors que d'autres ont tendance à créer un agent prêt à l'emploi,
DeepSeek
Harness ressemble plus à un ensemble de composants, permettant aux développeurs de décider eux-mêmes à quoi l'agent devrait ressembler et comment il devrait fonctionner.
Bien sûr, l'équipe officielle reste lucide. L'annonce indique qu'en tant que version de prévisualisation précoce, "de nombreux détails restent à améliorer et à peaufiner, et les plugins principaux ainsi que les interfaces de base évolueront rapidement par la suite". En fait, l'un des médias ayant participé au test, iFanr, a exprimé son étonnement : il est difficile d'imaginer que
DeepSeek
, réputé pour sa rapidité, puisse un jour prendre plus d'une demi-heure pour exécuter une tâche de programmation. Le numéro de version v0.1 indique également que cette baleine noire vient juste de faire surface et est loin de pouvoir nager librement.

03
De la vente de tokens à la livraison de résultats, l'ambition de la baleine noire
L'émergence de Harness coïncide avec un tournant dans toute l'industrie de l'IA.
Ces dernières années, la concurrence entre les entreprises de grands modèles s'est concentrée sur l'échelle des paramètres et les performances de référence. Mais en 2026, les capacités de base des principaux modèles convergent rapidement, les écarts dans les réponses ponctuelles se réduisent, et la guerre des prix s'intensifie. Le modèle économique consistant simplement à vendre des tokens atteint visiblement ses limites. L'industrie prend progressivement conscience que la valeur centrale de l'industrie de l'IA ne réside pas dans la sortie du modèle, mais dans son déploiement dans des scénarios réels — pour une même consommation de tokens, un bavardage a une valeur infime, tandis que corriger un bug ou développer une nouvelle fonctionnalité peut créer une valeur commerciale plusieurs fois supérieure.
La nouvelle publication de
DeepSeek
signifie son passage de la vente de puissance de calcul à la livraison de résultats. Dans l'ancien modèle, les clients payaient en fonction du volume d'appels de tokens, que le modèle ait réellement résolu le problème ou non. Dans le nouveau modèle, l'ancrage du paiement passe de la quantité de calcul consommée à la tâche accomplie.
Une autre raison pour laquelle la sortie de
DeepSeek
Harness a été très appréciée par les développeurs est la suivante.
DeepSeek
ne définit pas l'agent lui-même, mais utilise la capacité de diffusion de la communauté open source pour promouvoir une solution Harness. C'est une voie plus ambitieuse, et aussi plus difficile.
De plus, Harness affronte un marché mature déjà validé par Claude Code et Codex, ces derniers bénéficiant de l'avantage du premier entrant grâce aux itérations de modèles et aux ressources commerciales d'Anthropic et d'OpenAI. Après l'ouverture du code source, plusieurs questions restent en suspens : l'écosystème de plugins pourra-t-il prospérer de manière organique ? Les développeurs seront-ils prêts à confier leur environnement de production à une version 0.1 ? Les habitudes de paiement sur le marché intérieur pourront-elles soutenir la nouvelle logique du "paiement aux résultats" ?
DeepSeek
indique lui-même que les plugins principaux et les API évolueront rapidement, ce qui signifie que les premiers adoptants devront supporter les coûts liés aux changements d'interface.
Le 13 août, deux annonces ont eu lieu de part et d'autre du Pacifique. Elon Musk a présenté Grok 4.6, le qualifiant d'"intelligent, rapide et offrant un excellent rapport qualité-prix".
DeepSeek
, quant à lui, n'a rien dit et s'est contenté de publier des mises à jour.
Entre le bruit et le silence, c'est la divergence de deux philosophies commerciales.
Nous souhaitons le qualifier de "projet le plus prometteur de l'histoire de
DeepSeek
", non pas parce qu'il est déjà le plus performant aujourd'hui. V4 Pro présente encore des écarts avec les modèles SOTA (state of the art). Harness n'est qu'une version de prévisualisation développeur v0.1. La réaction du marché après l'augmentation des prix reste à observer, et la construction de l'écosystème est un long chemin. Le potentiel n'est tel que parce qu'il n'est pas encore réalisé.
Mais si l'on prend du recul, de R1 à V4, du modèle à Harness, chaque pas de
DeepSeek
va dans la même direction : rendre les capacités de pointe accessibles à un coût abordable, puis intégrer ces capacités abordables dans des systèmes exploitables.
La baleine noire est sortie de l'eau. Quant à savoir jusqu'où elle pourra nager, c'est dans le futur qui appartient à la communauté open source.
Cet article est issu du compte public WeChat "凤凰网科技" (Phoenix.com Technology), auteur : Dale, éditeur : Dong Yuqing







