Super super.
La version officielle de DeepSeek est encore en route, et le "meilleur Harness" communautaire a déjà fait son apparition en premier ! (Rien que pour nous tuer.jpg)
Le projet s'appelle "Pi", un Agent de programmation open source qui a attiré environ 86 000 étoiles sur GitHub.

La raison pour laquelle le projet est si explosif, c'est principalement parce que ce truc est trop "économe". . .
Regardez ce vieux développeur Evan Kim, après avoir connecté DeepSeek à Pi, environ 99,93% des Tokens d'entrée ont réussi à toucher le cache.
En d'autres termes, le taux d'échec du cache n'est que de 0,07%, la grande majorité des contextes répétitifs n'ont pas besoin d'être recalculés ???

Même, l'équipe de Composio a récemment testé horizontalement 8 Harness d'Agents principaux, en plaçant directement DeepSeek V4 Flash à l'intérieur pour exécuter des tâches réelles.
Après les résultats, c'est un peu dramatique aussi—
Le coût moyen de Pi pour accomplir une tâche réussie est le plus bas, nécessitant seulement environ 0,028 dollar.
Claude Code : Comment tu m'as directement propulsé à 7 fois le prix de Pi !!!

DeepSeek : Mes Tokens sont déjà vendus si bon marché.
Pi et d'autres projets économes : Pas de souci, je peux encore faire en sorte que les utilisateurs en achètent moins, hein.
Quatre outils avec DeepSeek, taux d'échec du cache aussi bas que 0,07%
Avant de parler de Pi, parlons un peu de ce qu'est vraiment un Harness.
Nous savons tous que les grands modèles en eux-mêmes ressemblent davantage à un cerveau responsable de la réflexion—
Pour qu'ils puissent réellement entrer dans un dépôt de code et travailler, il faut encore leur donner des yeux, des mains, des pieds et un flux de travail.
Par exemple, qui lit les fichiers, comment appeler le terminal, comment exécuter les tests après modification du code, ces systèmes d'ingénierie qui tournent autour du modèle sont collectivement appelés Harness.
C'est précisément pour cette raison que le même modèle avec un Harness différent peut présenter des différences énormes dans ses performances réelles et ses coûts d'appel !!
Et ce "Pi" créé par le développeur Mario Zechner, fait exactement construire un tel poste de travail de programmation pour les grands modèles.

J'ai parcouru le projet, et pour résumer brièvement, l'approche de Pi est assez "directe"—
C'est que cette chose, en fait, dès le départ, n'avait pas l'intention de tout mettre "toutes les fonctionnalités" dans le noyau. . .
Concrètement, par défaut, Pi ne donne au modèle que quatre outils—lire un fichier, écrire un fichier, modifier un fichier et exécuter une commande.
Si l'utilisateur a besoin d'un mode planification, de sous-Agents, de MCP, de points de contrôle Git ou de contrôle d'accès, il peut ensuite les installer un par un via des extensions et des Skills~
Emm... C'est un peu comme livrer d'abord une maison neuve avec eau et électricité, Pi est responsable de construire les quatre murs, et finalement, si on l'aménage en studio, en salle de jeu ou en trois pièces, tout dépend des modifications de l'utilisateur lui-même ??

Par hasard, cela correspond exactement aux besoins de DeepSeek. . .
Comme chacun sait, les capacités de raisonnement et de programmation de DeepSeek sont plutôt fortes, mais l'appel d'outils, la gestion du contexte et la relecture du contenu de réflexion ont leurs propres règles d'interface.
Cela conduit au fait que si nous le plaçons directement dans un Harness générique conçu autour d'OpenAI ou de Claude, nous rencontrons facilement des problèmes tels que l'incompatibilité des formats d'outils, des erreurs de relecture du contenu de raisonnement et l'inefficacité du cache.
N'est-ce pas, le produit officiel de DeepSeek est encore en route, Pi a d'abord pris les devants pour s'adapter—
En avril de cette année, Pi a ajouté la prise en charge native du fournisseur DeepSeek, tout en corrigeant l'erreur 400 dans la relecture des sessions V4.
Il conserve le reasoning_content selon les exigences de l'interface DeepSeek et mappe l'intensité de raisonnement interne de Pi au niveau de réflexion pris en charge par DeepSeek.
Vraiment· une personnalisation dédiée communautaire aussi.
Mais ! Ce qui a vraiment permis à Pi et DeepSeek de s'associer parfaitement, c'est le "cache".
Après tout, chaque étape exécutée par un Agent de codage nécessite d'envoyer à nouveau au modèle les invites système, les définitions d'outils, l'historique des conversations et le code, ce qui conduit à—
Plus les tâches du modèle durent longtemps, plus les requêtes s'allongent, et la plupart de ce contenu, DeepSeek l'a déjà vu. . .
C'est là que le cache de préfixe automatique entre en jeu.
Il peut temporairement mémoriser le début des requêtes déjà calculées. Lors du prochain appel, tant que l'invite système, les définitions d'outils et l'historique des conversations restent cohérents, cette grande partie du contenu peut être réutilisée directement, le modèle n'ayant besoin de traiter que les nouvelles informations ajoutées à la fin.
Et le "taux de réussite du cache" mesure précisément combien de Tokens dans cette entrée ont réussi à réutiliser les résultats de calcul précédents.
Plus le taux de réussite est élevé, moins il y a de Tokens à recalculer, et plus le coût d'appel est naturellement bas.
Mais le problème est également caché ici : ajouter une heure à l'invite, changer l'ordre des outils, et le cache peut instantanément oublier, nécessitant un nouveau calcul depuis le début.
Mais l'avantage de Pi, c'est qu'il est "suffisamment simple" : peu d'outils par défaut, le contenu de la session s'ajoute continuellement vers l'avant, on revient rarement modifier le contenu précédent.
De cette façon, lorsque DeepSeek ouvre le journal, les centaines de pages déjà vues peuvent être directement sautées, il ne traite que les quelques dernières pages nouvellement ajoutées, et le taux d'échec du cache est considérablement réduit~
N'est-ce pas, l'internaute Evan Kim est venu en personne le vérifier—
Le taux d'échec du cache après avoir connecté DeepSeek à Pi est aussi bas que 0,03%, correspondant à un taux de réussite du cache d'environ 99,97%.

En convertissant, cela signifie que les coûts de traitement de 10 milliards de tokens ne sont qu'environ 19 yuans, sans utiliser le cache, ce coût serait de plus de 900 yuans. .
De plus, l'équipe de Composio a récemment testé horizontalement 8 Harness d'Agents principaux, en plaçant directement DeepSeek V4 Flash à l'intérieur pour exécuter des tâches réelles.
Après les résultats, c'est un peu théâtral, le même DeepSeek, changer de Harness, l'écart de coût peut atteindre jusqu'à 7 fois ???

À première vue, c'est bien Pi Agent qui a le "coût moyen" le plus bas pour accomplir une tâche réussie, nécessitant seulement environ 0,028 dollar.
Suivent respectivement Deep Agents, Hermes Agent, OpenCode, Codex, Oh My Pi et Prime Agent.
Regardons maintenant le précieux Claude Code de chez A, le "candidat le plus cher" incontesté—
Pour accomplir une tâche réussie, il faut en moyenne environ 0,195 dollar, oui, près de 7 fois celui de Pi. . . (Le ciel s'effondre)
Bien sûr, ce chiffre ne signifie pas que Claude Code est incapable, après tout, il s'agit lui-même d'un système d'ingénierie complet construit autour du modèle Claude.
Disons simplement que lorsque le modèle sous-jacent est remplacé par DeepSeek, le flux de travail initialement optimisé pour l'écosystème Claude ne profite pas pleinement des avantages de faible coût et de haute efficacité du cache de DeepSeek.
Le modèle est toujours le même DeepSeek, Pi lui fait juste lire beaucoup moins de fois le contenu qu'il a déjà lu.
Pi : J'attends tranquillement que le Harness officiel me dépasse, hein.
Le Harness officiel est déjà en équipe, la cible vise directement Claude Code
Bien sûr, aussi adapté que soit Pi à DeepSeek, pour le moment, il s'agit toujours d'une solution tierce.
Après tout, DeepSeek lui-même a également décidé de se lancer personnellement dans la fabrication d'un Harness, et il est même probable que le jour de sa mise en ligne ne soit pas loin ? (Je devine)
En mai de cette année, le chercheur principal de DeepSeek, Chen Deli, a confirmé que l'entreprise formait en interne une équipe de Harness d'Agents, résumant son objectif par une phrase assez claire—
Créer le Harness DeepSeek Code à partir de zéro, visant à égaler Claude Code.
Ensuite, au cours de ces derniers mois, les postes de chef de produit Harness et d'ingénieur de R&D ont également été publiés en masse et mis à jour frénétiquement sur le site officiel, be like :

Puis fin juillet, le responsable de l'équipe DeepSeek Agent Harness, le grand maître ACM Cui Tianyi, a également recruté des développeurs pour des projets connexes en ligne.
C'est aussi presque sur le point d'aboutir.

En rassemblant les indices, le chemin de DeepSeek devient progressivement clair.
V4 est responsable de renforcer les capacités de raisonnement, de programmation et d'Agent sous-jacentes ; le Harness officiel est responsable de connecter le modèle au terminal, au dépôt de code et à la chaîne d'outils ; la gestion du contexte et les retours de test peuvent renvoyer les cas d'échec d'utilisateurs réels à l'équipe de modélisation.
Bien sûr, pour être honnête, une fois le produit officiel lancé, Pi ne perdra pas non plus sa place pour autant.
Le Harness DeepSeek se concentre sur le prêt à l'emploi et une collaboration plus profonde avec ses propres modèles.
Pi laisse le poste de travail aux utilisateurs pour qu'ils le modifient eux-mêmes, plus adapté aux développeurs qui aiment contrôler les outils, personnaliser les flux de travail et changer de modèle à tout moment.
Après tout, Pi ne s'est jamais attaché à DeepSeek dès le départ. . .
Claude, OpenAI, Gemini, Kimi, MiniMax sont tous pris en charge, aujourd'hui utilise DeepSeek pour économiser des Tokens, demain change d'autre modèle pour traiter des tâches spéciales, l'utilisateur peut basculer de fournisseur à tout moment.
Emm... Cela signifie également que le Harness officiel de DeepSeek doit vraiment faire face, en plus des produits de type Claude Code, à des postes de travail ouverts comme Pi qui ont déjà été assez bien adaptés par les développeurs. (doge)
Alors maintenant, la pression est officiellement transmise à la version officielle—
Le Harness que tu fais toi-même pour DeepSeek, il ne peut quand même pas être moins bon pour économiser des Tokens qu'un tiers, si ??? (doge)
Liens de référence :
[1]https://x.com/composio/status/2086814488162972027?s=20
[2]https://github.com/earendil-works/pi
Cet article provient du compte WeChat public "Quantum Bit", auteur : Meng Yao







