DeepSeek Harness vient d'être open-sourcé avec fracas : tout est un plugin

marsbitPublié le 2026-08-14Dernière mise à jour le 2026-08-14

Résumé

DeepSeek Harness, un cadre de développement d’agents IA en préversion, vient d’être publié en open source par DeepSeek. Construit sur le noyau Cordis, il repose sur le principe « tout est un plugin », permettant une modularité extrême où chaque composant (modèles, outils, interface, boucle d’agent elle-même) peut être assemblé ou remplacé via un fichier de configuration. Le framework offre des capacités étendues : exécution de commandes, édition de fichiers, navigation web, serveurs de langage, sous-agents et workflows. Il propose plusieurs modes (Standard, PTC, Minimaliste, Création) adaptés à différents besoins, du codage quotidien à l’expérimentation avancée. Une attention particulière est portée à la sécurité avec des stratégies de restriction d’accès par défaut et un journal de session complet pour audit et rejouabilité. DeepSeek Harness se présente sous plusieurs formes : interface Web, TUI en terminal, mode headless pour l’automatisation, et SDK Python/JSON-RPC. Plus qu’un simple assistant de programmation, il vise à fournir une base solide, observable et extensible pour construire des agents IA capables d’interagir de manière fiable avec des environnements réels.

Aujourd'hui, à l'aube,

DeepSeek
V4 Pro, la version officielle, a été publiée, déclenchant un vif engouement. Maintenant, une demi-journée plus tard,

DeepSeek
Harness
(version de prévisualisation pour les développeurs) est aussi disponible !

Bien sûr, cela n'est pas une surprise, car ce projet a été annoncé depuis longtemps, par exemple

DeepSeek
Harness L'équipe de Cui Tianyi a continué à poster des teasers sur les réseaux sociaux et à recruter des talents pour son équipe.

Nous avons également obtenu l'accès à la version bêta de

DeepSeek
Harness début août, profitant à l'avance de ce framework d'agent intelligent qui est destiné à apporter un nouveau changement à la communauté de l'IA.

Adresse du dépôt open source : https://github.com/deepseek-ai/deepseek-harness

Par exemple, ici, nous avons laissé le

DeepSeek
Harness configuré avec le modèle officiel

DeepSeek
-V4-Flash créer pour nous un jeu de tir de zombies à la première personne. Sans aucune intervention de notre part, nous avons obtenu en une trentaine de minutes un produit fini, certes imparfait mais déjà tout à fait jouable.

Étant donné que l'approche d'Andrej Karpathy pour générer des mondes 3D avec l'IA est très en vogue ces derniers jours, nous avons également fait relever à

DeepSeek
Harness(V4-Flash) le défi du benchmark « Huaqiang achète des pastèques » : recréer la scène classique « Huaqiang achète des pastèques » en animation 3D à partir d'une description textuelle (également le résultat d'une seule instruction) :

Dans l'ensemble, bien que loin d'être parfaite, l'animation reprend globalement l'histoire et les relations entre les personnages sont reconnaissables. En comparaison, l'animation que nous avons produite avec le même prompt, mais en utilisant Codex configuré avec GPT-5.6 sol-xhigh, était bien inférieure :

Il faut savoir que la taille des paramètres de

DeepSeek
-V4-Flash est bien inférieure à celle de GPT-5.6 sol. On peut imaginer que

DeepSeek
Harness doit y être pour beaucoup.

Aujourd'hui, avec la sortie de la version officielle de

DeepSeek
V4 Pro, nous avons également intégré ce modèle dans

DeepSeek
Harness et avons relancé le processus :

L'effet est en effet un peu meilleur.

Ensuite, en examinant la structure du projet, c'est impressionnant : le dépôt contient déjà plus de 230 membres du workspace, le code étant réparti dans les répertoires packages/, apps/, examples/, python/, native/, vendor/, website/, etc. Système de fichiers, terminal, sous-processus, PTY, serveur de langage, accès web, compétences, sous-agents, workflows, mode planification, persistance de session, paramètres, informations d'identification, télémétrie, presque chaque capacité possède son propre package.

Si on compare un projet d'agent ordinaire à un ordinateur déjà assemblé, alors

DeepSeek
Harness ressemble plus à une plaque de prototypage de taille impressionnante : le modèle, les outils, l'interface, le stockage, les politiques de sécurité et la gestion du contexte peuvent tous être branchés et débranchés.

Il fournit un plan d'assemblage par défaut, mais il est clair que ce que

DeepSeek
veut vraiment créer n'est pas un « assistant de programmation DeepSeek » de forme fixe, mais plutôt une méthode d'assemblage d'agents intelligents.

Qu'est-ce que DeepSeek Harness ?

Clarifions d'abord une question qui prête à confusion :

DeepSeek
Harness n'est pas un nouveau modèle

DeepSeek
, ni un simple client API. C'est un SDK et un framework d'application pour construire, exécuter et étendre des agents intelligents, qui peut par défaut se connecter aux modèles DeepSeek (mais peut aussi facilement se connecter à d'autres modèles), permettant au modèle de lire des projets, modifier des fichiers, exécuter des commandes, gérer des tâches, attribuer des sous-tâches, et d'interagir avec l'utilisateur via une interface Web, un terminal plein écran, une ligne de commande sans interface (Headless) ou des protocoles d'automatisation.

L'interface Web de

DeepSeek
Harness fournit une entrée pratique pour configurer directement d'autres services de modèle, sans que l'utilisateur ait à modifier manuellement les fichiers de configuration.

La communauté de l'IA n'est désormais plus étrangère au terme Harness. Son sens originel est harnais, faisceau, dispositif de retenue, etc. En l'abstrayant, son rôle est de connecter une force à une structure opérationnelle, tout en empêchant cette force de s'emballer. Concrètement dans le domaine de l'IA, Harness est responsable de connecter le modèle au système de fichiers, au shell, à l'éditeur de code, aux pages web et à d'autres agents, tout en enregistrant ce qu'il fait, en limitant ce qu'il peut faire, et en décidant, en cas d'erreur, s'il faut réessayer, annuler, compresser le contexte ou renvoyer le problème à l'utilisateur.

Cela explique peut-être aussi pourquoi la quantité de code et le nombre de packages de ce projet sont si importants, car les tâches et les choix d'outils impliqués sont nombreux, y compris l'appel d'outils pouvant être exécuté en parallèle, la possibilité d'arrêter réellement un sous-processus, la contamination du contexte par les résultats des outils, où doivent être insérées les nouveaux messages envoyés par l'utilisateur pendant l'exécution du modèle, comment reconstruire l'entrée du modèle lors de la reprise d'une session, quels outils possède un sous-agent, si l'écriture de fichiers peut dépasser l'espace de travail, et si le contenu vu lors de la relecture de l'interface est cohérent avec l'exécution en temps réel.



DeepSeek
Harness tente de transformer tous ces problèmes en capacités système formelles.

Tout est un plugin

La proposition de conception la plus frappante de

DeepSeek
Harness est « Tout est un plugin », la boucle de l'agent elle-même étant également considérée comme un plugin.

Le projet est construit sur le micro-noyau Cordis, un Harness en cours d'exécution est essentiellement un Contexte Cordis. Différents packages enregistrent des services, des événements et des capacités auprès du Contexte, qui sont finalement combinés par un fichier de configuration pour former un agent intelligent exécutable.

packages/core/ est le cœur de tout le système, contenant Session, System Prompt, Tools, Agent et Agent Loop. Ils résolvent les problèmes les plus fondamentaux : qu'est-ce qu'une session, comment est assemblé l'invite système, comment les outils sont enregistrés et appelés, comment l'agent est créé, et comment un tour de conversation passe de l'entrée de l'utilisateur à la requête du modèle, à l'exécution des outils et à la réponse finale.

Au-delà du noyau, il y a de nombreux packages de capacités :

  • packages/llm/ est responsable des adaptateurs de modèle et de la sortie en streaming ;
  • packages/shell/, packages/subprocess/ et packages/terminal/ sont responsables des commandes ponctuelles, de l'arborescence des processus et du terminal persistant ;
  • packages/fs/ est responsable de la lecture/écriture, de l'édition, de la recherche et des restrictions de stratégie des fichiers ;
  • packages/lsp/ se connecte au serveur de langage, permettant à l'agent non seulement de rechercher du texte, mais aussi d'obtenir une navigation sémantique du code ;
  • packages/web/ est responsable de la recherche et du scraping web ;
  • packages/skill/ gère les compétences réutilisables ;
  • packages/subagent/ et packages/workflow/ étendent l'agent unique en un système multi-agents pouvant déléguer et orchestrer.

En regardant plus loin, la planification, les objectifs, les tâches à faire, les tâches en arrière-plan, la compression du contexte, l'interrogation des sessions, le titre de session, les informations d'identification, les paramètres utilisateur, les mécanismes d'approbation et la télémétrie sont également divisés en capacités indépendantes. La partie la plus intéressante de cette structure est qu'elle reflète une conscience presque obstinée des frontières : qui possède l'interface, qui est responsable de l'implémentation, qui expose la capacité au modèle, en essayant autant que possible de ne pas les mélanger.

La documentation du projet divise les capacités typiques en trois couches : interface, implémentation et consommateur.

Prenons Bash comme exemple : l'interface définit ce qu'est « exécuter une commande », l'implémentation locale est responsable de la création réelle du processus, et le package d'outils destiné au modèle est responsable de transformer cette capacité en schéma et résultats compréhensibles par le modèle. À l'avenir, si le shell local doit être remplacé par un conteneur distant, un bac à sable cloud ou une plateforme d'exécution d'entreprise, théoriquement, seule la couche d'implémentation doit être remplacée, sans avoir à réécrire les outils du modèle et la boucle de l'agent.

C'est une pensée typique de framework. Cela rendra le dépôt important au début, mais cela montre aussi que l'objectif de

DeepSeek
Harness n'est pas de créer un produit fini que seules les équipes officielles peuvent maintenir, mais de permettre aux différents déploiements de changer de modèle, de stockage, de stratégie de sécurité, d'ajouter des outils, voire de remplacer la boucle de l'agent intelligent.

Ici, nous voyons également l'engagement de

DeepSeek
en faveur d'un véritable open source !

cordis.yml

Un fichier de configuration assemble différents agents

L'architecture par plugins se concrétise finalement pour les développeurs via cordis.yml. Le fichier de configuration liste les noms des plugins, les ID stables et les paramètres, décidant quelles capacités exactes possède l'agent actuel.

Le même code peut être assemblé en des produits de forme complètement différente. Ajoutez l'adaptateur LLM DeepSeek, le système de fichiers, Bash et TUI, et vous obtenez un agent de programmation dans le terminal ; remplacez l'interface d'interaction par le plugin Web, et vous obtenez une application de navigateur ; utilisez l'entrée Headless, il accepte une tâche, complète les tours de modèle et d'outils, imprime la réponse et se termine ; remplacez-la par une façade ACP ou JSON-RPC, et il peut devenir un service automatisé que d'autres programmes peuvent piloter.

La configuration prend également en charge les couches de recouvrement. TUI et Web UI peuvent partager une configuration de base, superposée avec leurs propres plugins d'interface et paramètres ; la configuration personnelle se situe quant à elle dans la dernière couche. Ainsi, le déploiement n'a pas besoin de copier l'arborescence de configuration entière, il suffit de remplacer les plugins spécifiés. Cependant, il y a un détail à noter ici : le correctif de configuration remplace l'ensemble du config du plugin cible, il ne s'agit pas d'une fusion en profondeur. Si vous n'écrivez qu'un nouveau champ, les clés API, les adresses de base ou autres paramètres existants peuvent également disparaître. C'est explicite, mais pas forcément intuitif pour un premier utilisateur.

Le projet permet également de lire les variables d'environnement et les expressions d'exécution via !!js dans le YAML, par exemple en récupérant la clé secrète depuis DEEPSEEK_API_KEY. La configuration ne fait référence qu'au nom des informations d'identification, la clé est résolue lors de l'appel réel. L'interface Web écrira la clé dans $DSH_HOME/.credentials.yaml, tandis que les variables d'environnement et .env peuvent servir de sources de secours pour l'automatisation ou le développement local ; les clés ne doivent pas être écrites directement dans cordis.yml ni entrer dans les logs de session.

Agent Loop

Pas une boucle, mais un ensemble de règles de circulation

Le code central de nombreux projets d'agent précoces peut être simplifié en quelques lignes : envoyer le message au modèle, si le modèle renvoie un appel d'outil, exécuter l'outil, puis renvoyer le résultat au modèle, jusqu'à ce que le modèle produise du texte.

DeepSeek
Harness Bien sûr, il fait aussi cela, mais il divise ce processus en un cycle de vie strict.

Une entrée utilisateur ouvrira un Tour (Turn), un Tour peut contenir plusieurs Étapes (Step) ; une Étape correspond à une requête de modèle et à son exécution d'outils ultérieure. Avant la requête, le système assemble l'invite système stable, l'environnement d'exécution actuel, le schéma des outils et les messages de la session ; après la requête, les segments (chunk) en streaming du modèle, le message complet, les appels d'outils, les résultats des outils et la raison de la fin entreront tous dans le flux d'événements.

Le jeu de tir de zombies mentionné ci-dessus a exécuté 3 tours, 127 étapes.

L'outil n'est pas non plus « appelle dès qu'il obtient le nom de la fonction ». Il passera par une stratégie préalable, une garde de sécurité irréversible, l'exécution réelle, un traitement postérieur, une organisation du contenu et une notification des résultats. Autorisation ou refus, dépassement de délai, nouvelle tentative, statistiques de métriques, ajout de contexte, peuvent tous être connectés à différents points de la ligne de production. Un outil peut déclarer que les appels sous un certain type de paramètre sont sûrs en concurrence, le planificateur exécutera alors les tâches de lecture seule consécutives en parallèle ; une fois qu'il rencontre un appel modifiant l'état ou dont la sécurité ne peut être déterminée, il le traite comme une barrière, attendant que les tâches précédentes se terminent avant de l'exécuter de manière exclusive.

Cette conception peut sembler un peu comme installer un système de contrôle aérien sur un chemin de campagne, mais lorsque l'agent commence à rechercher dix fichiers en même temps, exécuter des tests, accepter des instructions supplémentaires de l'utilisateur, et doit en plus permettre l'annulation à tout moment, ces règles passeront rapidement de la « conception excessive » aux « choses que l'on souhaiterait avoir plus tôt dans le rapport d'enquête sur un incident ».

Il traite également sérieusement la destination des messages reçus pendant l'exécution. Le nouveau contenu envoyé par l'utilisateur pendant le travail de l'agent peut être la tâche suivante, ou une instruction de redirection pour le travail en cours. Le système distingue les messages en attente, l'injection de contexte et le pilotage (Steering), et confirme via un accusé de réception si une instruction de pilotage est réellement entrée dans une requête de modèle spécifique. En d'autres termes, il ne se contente pas de savoir si « le message a été reçu », mais aussi « à quelle étape exacte le modèle l'a vu ».

Session Log

La véritable source d'autorité de tout le système

Une autre conception notable de

DeepSeek
Harness est le Journal de Session (Session Log).

Le projet stipule que tout contenu vu par le modèle doit pouvoir être reconstruit à partir du journal. Les messages utilisateur, le contexte de l'environnement d'exécution, les informations de requête du modèle, la sortie en streaming, les appels et résultats d'outils, les événements de compression, les changements de permission, les raisons d'annulation, tous entreront sous forme d'événements dans le flux de session en ajout. L'interface, la persistance, la reprise, le Fork, la télémétrie et la relecture ne devraient pas maintenir chacun un état « à peu près correct », mais dériver de la même source d'événements.

Ce principe résout un problème très épineux dans les systèmes d'agents : lorsqu'une tâche échoue, pouvons-nous vraiment savoir ce que le modèle a vu à ce moment-là ?

Si le système ne sauvegarde que le texte de conversation final, de nombreux facteurs clés seront perdus. Peut-être que juste avant la requête du modèle, l'état de l'espace de travail venait d'être injecté, peut-être que les résultats des outils ont été tronqués, peut-être que le système a automatiquement changé le routage du modèle, peut-être que l'utilisateur a changé de direction en plein milieu de la sortie en streaming.

DeepSeek
Harness sauvegardera, aux limites des requêtes, des enregistrements suffisants pour reconstruire les messages, les segments de streaming originaux seront également conservés, afin que l'interface et la relecture restent cohérentes.

La persistance de session elle-même reste un plugin. Le projet fournit des backends comme JSONL et SQLite, la capacité de requête peut accéder en priorité à la session en direct, mais peut également rechercher dans l'historique via la recherche en texte intégral de SQLite. Resume continuera le travail avec la session d'origine, Fork dérivera une nouvelle session à partir d'une limite historique déterminée. Pour les développeurs, cela fournit une base unifiée pour le débogage, l'évaluation, l'audit et l'automatisation.

D'un agent à un groupe d'agents



DeepSeek
Harness intègre déjà diverses capacités de sous-agents et de workflows.

L'agent principal peut déléguer des tâches à des sous-agents, un sous-agent peut être une instance nouvellement créée, un Fork à partir d'une limite terminée d'une session existante, ou une connexion à un processus externe via ACP.

Le jeu de tir de zombies mentionné ci-dessus a créé 5 sous-agents exécutés en parallèle.

La conception de la portée (scope) est importante ici. Chaque agent possède sa propre couche de contexte, pouvant voir des outils, des invites et des commandes spécifiques. Un sous-agent peut être limité à ne faire que de la recherche et de l'analyse, un autre peut être autorisé à modifier des fichiers. Les capacités enregistrées dans la portée d'un agent sont automatiquement nettoyées avec le cycle de vie de l'agent, évitant de dépendre de conventions de nommage globales pour maintenir l'isolation.

Le workflow va encore plus loin : il permet de piloter l'orchestration multi-agents avec un script, reliant plusieurs sous-tâches, sorties structurées et exécution continue. Le projet fournit simultanément des objectifs, plans, tâches à faire et tâches en arrière-plan. Ce ne sont pas seulement quatre petits composants d'interface avec des noms similaires, ce sont en réalité des états de collaboration à différents cycles de vie. Le mode plan enregistre la phase de collaboration actuelle, les objectifs peuvent persister sur la même session, les tâches à faire fournissent une liste de tâches légère pour le modèle, les tâches en arrière-plan sont quant à elles responsables de la gestion du travail réel encore en cours.

Cela montre que Harness ne souhaite pas seulement couvrir la « programmation question-réponse ». Il espère supporter les tâches longues, les investigations parallèles, l'exécution automatisée et la coordination avec les systèmes externes. Quant à savoir si le modèle peut maîtriser de manière stable autant de mécanismes, c'est un autre test ; au moins le framework a d'abord créé le volant, le tableau de bord et les freins.

Web, TUI, Headless et SDK

Pour les utilisateurs ordinaires, le projet recommande l'interface Web, écoutant par défaut sur http://127.0.0.1:3080. Elle offre la conversation, la barre latérale des sessions, la sélection des permissions, le mode planification, les cartes d'outils et l'interaction avec l'espace de travail.

L'interface Web fournit également quatre modes prédéfinis pour l'agent. Ce ne sont pas quatre ensembles d'agents indépendants, ni seulement des changements de style d'invite, mais plutôt, basés sur le même hôte Harness, ils assemblent pour la session actuelle différents outils, invites et capacités d'exécution :

Mode Standard : L'agent de programmation général le plus complet, fournissant l'édition de fichiers, Shell, recherche de fichiers et web, Compétences, planification, objectifs, sous-agents et workflows, adapté à la grande majorité des tâches de développement quotidiennes ;

Mode PTC : Conserve toutes les capacités du mode standard, tout en présentant les outils au modèle via le SDK Code Mode. Le modèle peut écrire un programme TypeScript, combinant plusieurs opérations en un seul run_code, réduisant les allers-retours répétés entre le modèle et les outils, plus adapté aux tâches complexes avec des chaînes d'appels longues ;

Mode Minimaliste : Ne fournit que deux outils : Bash persistant et str_replace_editor. Un ensemble d'outils plus réduit diminue la charge de choix et de contexte, adapté aux tâches de programmation avec un chemin clair, où l'on souhaite que l'agent passe directement à l'action ;

Mode Création : Ajoute au mode standard la vérification du runtime Cordis, l'expérimentation temporaire de plugins et le guide de création de presets d'agents. L'agent peut non seulement utiliser les outils existants, mais aussi explorer et recombiner son propre runtime, créant ainsi de nouveaux presets personnalisés. Puisqu'il peut exécuter du code de plugin écrit par le modèle, c'est un mode de haute confiance pour les utilisateurs avancés.

Cet ensemble de presets est peut-être l'expression la plus intuitive du produit pour « tout est un plugin » : le routage du modèle sous-jacent, la persistance de session, le bac à sable et l'approbation sont toujours fournis par l'hôte partagé, le preset ne décide que quelles capacités exactes sont chargées dans un Contexte d'Agent spécifique. La même interface Web peut ainsi passer d'un agent minimaliste à deux outils, au mode standard capable d'orchestrer des sous-agents, et même devenir un mode création capable de se modifier lui-même.

Par exemple, ici, en mode création, nous avons laissé le

DeepSeek
Harness connecté à

DeepSeek
V4 Pro créer un « mode trois colonnes » que l'interface Web officielle ne possède pas :

En dehors de l'interface Web, le TUI s'adresse aux développeurs qui préfèrent rester dans le terminal.

Le mode Headless convient aux scripts et à l'intégration continue (CI) : il accepte une tâche, attend que l'agent s'arrête complètement, sort la dernière réponse valide et se termine. Si le programme nécessite des événements structurés et un contrôle continu, il doit utiliser ACP ou JSON-RPC / le SDK Python.

En matière d'automatisation, le projet fournit un service ACP et une entrée JSON-RPC. Le SDK Python pilote le runtime JSON-RPC fourni, permettant aux applications Python de démarrer des sessions, d'envoyer des tâches, de recevoir des notifications, sans avoir à intégrer directement le noyau Node. Le dépôt contient également des exemples comme Code Mode, Cordis autoréférentiel, service de mémoire MCP, etc.

Il est important de noter que ces entrées ne sont pas quatre agents évoluant chacun de leur côté. Ils partagent le modèle de capacité central, la sémantique d'événements de session et la plupart des plugins de base, mais il ne s'agit pas simplement de remplacer une couche d'interface, mais plutôt d'assembler via différents bundles des formes de produits comme Web, tâches ponctuelles et services automatisés. C'est le résultat le plus intuitif de « tout est un plugin ».

L'agent peut s'inspecter et même se modifier



DeepSeek
Harness fournit également un ensemble d'outils Cordis autoréférentiels (self-referential). Ils n'entrent pas dans les modes standard, PTC ou minimaliste, mais sont fournis via le « mode création » dans l'interface Web comme point d'entrée avancé explicite. Après avoir choisi ce preset, l'agent peut inspecter l'arborescence des plugins du runtime actuel, et monter ou démonter dynamiquement des plugins temporaires.

Cela ressemble un peu à demander à une voiture de changer son propre moteur sur l'autoroute, c'est pourquoi le projet ne l'active pas par défaut. Il convient aux scénarios de recherche ou d'automatisation avancée : le modèle peut écrire temporairement un écouteur d'événements, enregistrer un nouvel outil, fournir un service, puis le démonter une fois la tâche terminée.

Un agent auto-modifiable peut facilement devenir une simple démonstration de concept, mais Harness l'a au moins placé dans le cycle de vie existant des plugins. Les plugins dynamiques s'exécutent toujours sous le mécanisme de Contexte et d'Effet de Cordis, les éléments d'enregistrement ont un chemin de nettoyage clair.

C'est encore loin d'être sans risque, mais cela montre l'endroit où cette architecture veut vraiment arriver : l'agent intelligent n'utilise pas seulement les capacités, il peut aussi recombiner son propre runtime dans une frontière contrôlée.

La conception derrière Cordis peut être consultée dans l'article publié simultanément par l'équipe officielle, « A Programming Paradigm for Spatiotemporal Composability » :

Adresse de l'article : https://github.com/cordiverse/paper

Stratégie de sécurité

Une fois qu'un agent de programmation obtient les permissions du système de fichiers et du Shell, il peut modifier du code, installer des dépendances, démarrer des processus, voire toucher à l'environnement de l'hôte en dehors de l'espace de travail.

DeepSeek
Harness considère clairement cela comme un problème d'infrastructure fondamentale, et non comme une simple fenêtre de confirmation ajoutée à l'interface.

Le projet adopte par défaut le mode workspace-write, limitant l'exécution des commandes et la modification des fichiers à l'espace de travail actuel et aux répertoires temporaires autorisés, et combiné avec la stratégie d'approbation ask pour traiter les opérations nécessitant une extension des permissions. Le mode plus permissif danger-full-access existe également, mais doit être explicitement choisi par le déploiement ; il ne sera pas emballé comme une option de compatibilité apparemment inoffensive.

Les appels d'outils doivent également passer par une stratégie préalable, une garde de sécurité monotone (monotonic safety guard), un wrapper d'exécution et un traitement postérieur. Une opération refusée par la garde ne peut pas être réautorisée par un plugin ultérieur ; une commande nécessitant une extension de permission doit expliquer la raison et être réessayée via le mécanisme d'approbation. Le système de fichiers, Bash et les sous-processus partagent la même stratégie de bac à sable, évitant une frontière fracturée où « les commandes sont limitées, mais les outils de fichiers peuvent contourner ».

Plus remarquable encore,

DeepSeek
Harness adopte le principe de « défaillance en position fermée » (fail-closed). Si le système ne peut pas confirmer que le mécanisme d'isolation est réellement efficace, il refuse l'exécution, au lieu de se dégrader silencieusement en une exécution sans protection. Le changement de permission, la demande d'approbation, les paramètres des outils, les résultats d'exécution et les raisons d'annulation entreront également dans le Journal de Session, fournissant une base pour l'audit ultérieur et la reproduction des problèmes.

Cette conception n'élimine pas tous les risques de l'exécution d'opérations locales par un agent intelligent, mais elle reflète une attitude d'ingénierie rare : la sécurité est une contrainte systémique qui traverse les mécanismes de configuration, d'exécution, d'approbation, de journalisation et de reprise. Le modèle peut proposer une action, mais ce qui décide réellement si l'action peut avoir lieu, c'est toujours Harness.

Ce que DeepSeek veut faire n'est pas seulement « un autre Codex »

Si l'on ne regarde que l'interface Web ou le TUI, il est facile de comprendre

DeepSeek
Harness comme une version DeepSeek de Codex, Claude Code ou d'autres assistants de programmation. Mais en regardant la structure du dépôt, son objectif est clairement plus fondamental.

L'application par défaut est bien sûr importante, elle permet aux développeurs d'obtenir directement un outil capable de lire/écrire des projets, d'exécuter des commandes, de planifier des tâches et d'appeler des sous-agents. Mais ce qui occupe vraiment le centre du projet, ce sont les interfaces de capacité remplaçables, le cycle de vie piloté par les événements, le journal de session faisant autorité et la composition déclarative. En d'autres termes, l'agent fini ressemble davantage au premier client de ce SDK.

Cela complète également l'écosystème de modèles de

DeepSeek
avec une pièce du puzzle qui n'était pas très visible auparavant. Le modèle détermine l'intelligence supérieure, Harness détermine comment cette intelligence entre dans l'environnement réel, comment utiliser les outils, comment conserver l'état, et comment travailler dans les limites des permissions. Pour les développeurs d'entreprise, ce dernier point est souvent plus important que d'avoir quelques boutons de plus dans la fenêtre de chat, car il détermine si le système peut être audité, étendu, remplacé et maintenu à long terme.



DeepSeek
Harness est encore loin d'être à l'étape « installation terminée, tout est fluide », mais il a déjà montré un ensemble de jugements techniques assez complets : l'agent ne devrait pas être une boucle de plus en plus lourde, mais plutôt un ensemble de capacités qui peuvent être combinées, observées et remplacées ; une session ne devrait pas être seulement un historique de chat, mais plutôt des faits d'exécution ; un outil ne devrait pas être seulement une fonction, mais devrait simultanément posséder des stratégies, une journalisation et un protocole de présentation.

Par conséquent, le plus digne d'attention concernant

DeepSeek
Harness n'est pas de savoir s'il peut aujourd'hui remplacer l'assistant de programmation que vous utilisez, mais à quel point il a rendu public la réponse de DeepSeek à l'ingénierie des agents.

Cet article provient du compte officiel WeChat « Machine Heart » (ID : almosthuman2014), auteur : Machine Heart qui suit DSH.

Questions liées

QQu'est-ce que DeepSeek Harness et quelles sont ses principales caractéristiques ?

ADeepSeek Harness est un SDK et cadre applicatif open-source pour construire, exécuter et étendre des agents intelligents. Sa principale caractéristique est le principe « tout est un plugin », où même la boucle de l'agent elle-même est considérée comme un plugin. Il repose sur le micro-noyau Cordis, permettant un assemblage modulaire des capacités via un fichier de configuration (cordis.yml). Il intègre une gestion avancée des sessions, des outils, des sous-agents, des workflows, et des mécanismes de sécurité granulaires.

QQuels sont les différents modes d'agent disponibles dans l'interface Web de DeepSeek Harness ?

AL'interface Web de DeepSeek Harness propose quatre modes prédéfinis : le mode Standard (agent de codage complet avec édition de fichiers, shell, recherche, etc.), le mode PTC (capacités similaires mais avec un SDK pour permettre au modèle de combiner des opérations en une seule exécution), le mode Minimaliste (seulement un terminal Bash et un éditeur basique pour les tâches directes), et le mode Création (inclut des outils d'inspection et d'expérimentation du runtime Cordis, permettant à l'agent de créer de nouveaux modes personnalisés).

QComment DeepSeek Harness gère-t-il la sécurité et les autorisations lors de l'exécution de commandes ?

ADeepSeek Harness adopte une approche système stricte en matière de sécurité. Par défaut, il utilise le mode « workspace-write », limitant l'exécution des commandes et la modification des fichiers au répertoire de travail actuel. Les appels d'outils passent par des phases de stratégie préalable, de garde-fous de sécurité monotones, d'exécution encapsulée et de post-traitement. Une approbation explicite (mécanisme 'ask') est requise pour les opérations nécessitant des autorisations étendues. Le principe est « fail-closed » : si l'isolation n'est pas garantie, l'exécution est refusée. Toutes les décisions sont enregistrées dans le Journal de Session.

QQuel est le rôle du 'Session Log' (Journal de Session) dans DeepSeek Harness ?

ALe Session Log (Journal de Session) est la source de vérité du système. Il enregistre sous forme d'événements tout ce que le modèle perçoit : messages de l'utilisateur, contexte d'exécution, requêtes au modèle, sorties en flux continu, appels d'outils, résultats, événements de compression, changements de permissions, etc. Ce principe garantit que l'état de la session peut être reconstruit de manière fiable à tout moment, ce qui est essentiel pour le débogage, la reprise, la duplication (Fork), l'audit et la relecture des interactions.

QComment DeepSeek Harness permet-il de créer des systèmes multi-agents ?

ADeepSeek Harness intègre des capacités natives pour les sous-agents et les workflows. Un agent principal peut déléguer des tâches à des agents secondaires. Ces sous-agents peuvent être des instances nouvellement créées, des duplications (Fork) d'une session existante, ou connectés via ACP. Chaque agent a son propre contexte et une portée définie pour ses outils et ses permissions. Le module Workflow permet d'aller plus loin en orchestrant plusieurs agents via des scripts, gérant des tâches structurées, des objectifs, des plans et des tâches en arrière-plan.

Lectures associées

Après les obligations d'État américaines tokenisées, les actions tokenisées deviennent le nouveau champ de bataille des RWA

Après la tokenisation des bons du Trésor américain, les actions tokenisées émergent comme le nouveau champ de bataille des actifs réels tokenisés (RWA). Le marché des actions tokenisées connaît une croissance rapide, atteignant environ 1,9 milliard de dollars, tandis que celui des bons du Trésor stagne autour de 150 milliards de dollars. Les acteurs, allant des infrastructures traditionnelles comme le DTCC, NYSE et NASDAQ aux plateformes Web3 comme Securitize, Ondo et xStocks, ainsi que Robinhood et Coinbase, explorent différentes approches réglementaires. La SEC a établi un cadre de classification pour les titres tokenisés, incluant les titres parrainés par l'émetteur, les titres tokenisés sous garde, les titres liés et les swaps sur titres. Securitize adopte une approche directe de tokenisation avec une conformité stricte mais une utilisation limitée sur la chaîne. Ondo et xStocks utilisent des titres de créance adossés à des actions pour une accessibilité plus large et une utilisation DeFi, bien que fragmentant la liquidité. Robinhood propose désormais des "Stock Tokens" similaires, tirant parti de sa base d'utilisateurs. Les infrastructures traditionnelles comme le DTCC testent la tokenisation pour améliorer l'efficacité. L'enjeu réside dans la convergence vers un écosystème unifié permettant des transactions d'actifs plus accessibles et efficientes. L'évolution réglementaire et l'adoption des actions tokenisées pourraient devenir un catalyseur clé pour l'expansion du secteur RWA.

marsbitIl y a 41 mins

Après les obligations d'État américaines tokenisées, les actions tokenisées deviennent le nouveau champ de bataille des RWA

marsbitIl y a 41 mins

Nvidia est cédé collectivement, qu'ont flairé les fonds d'investissement privés ?

Plusieurs fonds d'investissement chinois majeurs, dont GaoYi Asset et Greenwoods, ont réduit ou liquidé leurs positions dans Nvidia au deuxième trimestre, selon leurs déclarations 13F. Cette réallocation coïncide avec des achats importants dans Taiwan Semiconductor Manufacturing Company (TSMC) et des acteurs de la mémoire comme Micron et SanDisk. L'analyse souligne un changement de logique d'investissement dans le secteur de l'IA, passant d'une phase de valorisation par les « anticipations » à une phase axée sur la « matérialisation » des bénéfices. Les investisseurs cherchent désormais des entreprises aux bénéfices visibles et aux valorisations moins élevées. TSMC est privilégié pour son rôle de goulot d'étranglement incontournable, grâce à son monopole sur les procédés de fabrication avancés et les capacités d'emballage CoWoS, essentielles pour les puces IA. Son pouvoir de fixation des prix semble solide à moyen terme. Les actions de mémoire (Micron, SanDisk) sont vues comme une opportunité de « double effet » (Davis Double), combinant un rebond cyclique du secteur et une demande structurelle tirée par l'IA (mémoire HBM). Leur valorisation est considérée comme attrayante. La réduction des positions sur Nvidia reflète principalement une préoccupation sur le ratio risque/rendement après une hausse vertigineuse. Le marché exige désormais des bénéfices toujours supérieurs aux attentes, tandis que des risques de compression des marges émergent (coûts de HBM, emballage, concurrence des puces maison des géants cloud). Cela ne signifie pas un rejet de la tendance IA, mais une migration des capitaux vers d'autres segments de la chaîne de valeur où les profits pourraient se redéployer. En résumé, ces mouvements indiquent une évolution de la phase d'investissement en IA : les profits excédentaires commencent à migrer des concepteurs de puces (comme Nvidia) vers les fabricants (comme TSMC) et les fournisseurs de mémoire, qui détiennent des contraintes physiques (capacités de production) génératrices de pouvoir de fixation des prix.

marsbitIl y a 1 h

Nvidia est cédé collectivement, qu'ont flairé les fonds d'investissement privés ?

marsbitIl y a 1 h

Test de Turing inversé : ce « grand modèle entièrement artisanal » a rendu les internautes dingues

Le projet "ChatTJB", présenté comme un "grand modèle linguistique entièrement artisanal", s'avère en réalité être une expérience artistique et une satire des IA. Derrière cette prétendue intelligence artificielle se cache un humain nommé Tucker, qui répond manuellement à chaque requête des utilisateurs via un site web conçu pour imiter les interfaces des chatbots d'IA. L'initiative, lancée avec une publicité sur un panneau d'affichage à San Francisco, a connu un succès inattendu, submergeant son créateur qui doit désormais gérer des milliers de conversations. Face à cette demande, le projet a dû suspendre les nouvelles inscriptions et envisage de recruter des bénévoles, ironiquement qualifiés d'"Average Individual" (Individus Ordinaires). L'expérience souligne la rareté et la valeur d'une interaction humaine authentique à l'ère numérique. Alors que les IA gèrent des conversations massives et instantanées, l'engagement personnel de Tucker - lire, réfléchir et répondre manuellement - crée une connexion unique. L'auteur note que de nombreux utilisateurs, venus initialement par curiosité ou pour s'amuser, finissent par partager des préoccupations sincères, attirés par la certitude qu'une personne réelle les écoute et répond avec attention. Le projet met en lumière un désir latent pour des échanges plus humains et moins automatisés. L'article mentionne également une plateforme similaire, "Your AI Slop Bores Me", où des milliers d'utilisateurs jouent alternativement le rôle de demandeurs ou de "modèles" humains chargés de répondre ou de dessiner manuellement. En conclusion, l'initiative ChatTJB, bien que présentée avec humour et des termes techniques parodiques, interroge notre relation à la technologie et rappelle l'importance fondamentale de la connexion humaine dans la communication.

marsbitIl y a 1 h

Test de Turing inversé : ce « grand modèle entièrement artisanal » a rendu les internautes dingues

marsbitIl y a 1 h

Du jour au lendemain, GPT-5.6 Sol a été accéléré 14 fois par OpenAI

OpenAI, en partenariat avec Cerebras, a dévoilé en préversion un nouveau mode « Ultrafast » pour son modèle phare GPT-5.6 Sol. Ce mode permet d'atteindre une vitesse de génération allant jusqu'à 750 tokens par seconde, soit une accélération d'un facteur 14 par rapport au mode standard, sans perte de qualité. Il surpasse ainsi largement les performances de modèles concurrents comme Claude Fable 5 ou Opus 4.8. Cette avancée repose sur l'architecture matérielle révolutionnaire de Cerebras, utilisant des puces de la taille d'une tranche de silicium (WSE-3). Elles évitent les goulots d'étranglement de la mémoire des GPU traditionnels en conservant les paramètres du modèle dans une mémoire SRAM ultra-rapide intégrée. Lors du test exigeant « Humanity's Last Exam », GPT-5.6 Sol en mode Ultrafast a répondu à 2500 questions complexes en seulement 11 heures, contre plus de 78 heures pour un modèle rival. Cette vitesse ouvre la voie à de nouvelles applications en temps réel : réponse aux incidents techniques, analyse financière instantanée, support client avancé ou recherche interactive accélérée. Le mode Ultrafast est d'abord disponible en préversion limitée via l'API OpenAI, promettant de transformer les flux de travail nécessitant des raisonnements complexes et des appels en chaîne d'outils, en réduisant des processus de plusieurs heures à quelques minutes.

marsbitIl y a 1 h

Du jour au lendemain, GPT-5.6 Sol a été accéléré 14 fois par OpenAI

marsbitIl y a 1 h

Trading

Spot
活动图片