¡Genial, genial!
Mientras la versión oficial de DeepSeek aún está en camino, ¡el 'Harness óptimo' de la comunidad ya ha salido disparado! (vamos a exprimirlo hasta el límite.jpg)
El proyecto se llama "Pi", un Agente de programación de código abierto que ha arrasado con aproximadamente 86,000 estrellas en GitHub.

La razón principal por la que el proyecto es tan popular es que es extremadamente económico...
Observen al desarrollador Evan Kim; después de integrar DeepSeek en Pi, aproximadamente el 99,93% de los tokens de entrada se almacenaron en caché con éxito.
En otras palabras, la tasa de fallos de caché es de solo el 0.07%, ¿lo que significa que la gran mayoría del contexto repetido no necesita recalcularse?

Incluso, el equipo de Composio recientemente realizó pruebas comparativas de 8 Harness de Agentes principales, ejecutando directamente DeepSeek V4 Flash en tareas reales.
Después de los resultados, fue un poco dramático—
Pi tuvo el costo promedio más bajo para completar una tarea exitosa, aproximadamente $0.028 dólares.
Claude Code: ¡¿Cómo es que me dejaron a 7 veces el precio de Pi?!

DeepSeek: Mis tokens ya están tan baratos.
Pi y otros proyectos ahorrativos: No pasa nada, todavía puedo hacer que los usuarios compren menos, ja.
Cuatro herramientas con DeepSeek, tasa de fallos de caché baja hasta el 0.07%
Antes de hablar de Pi, hablemos un poco sobre qué es realmente un Harness.
Todos sabemos que los modelos grandes en sí son más como un cerebro responsable del pensamiento—
Para que realmente entre en un repositorio de código a trabajar, necesitamos darle ojos, manos y un flujo de trabajo.
Por ejemplo, quién lee los archivos, cómo llama a la terminal, cómo ejecutar pruebas después de modificar el código. Estos sistemas de ingeniería que rodean el funcionamiento del modelo se denominan colectivamente Harness.
Precisamente por eso, el mismo modelo con un Harness diferente puede mostrar diferencias enormes en rendimiento real y costos de llamada!!
Y este "Pi" creado por el desarrollador Mario Zechner, hace exactamente eso: construir una plataforma de trabajo de programación para modelos grandes.

Después de revisar el proyecto, resumiendo brevemente, la idea de Pi es bastante directa—
Es decir, desde el principio, esta cosa no tenía la intención de meter "todas las funciones" en el núcleo...
Específicamente, en la configuración predeterminada, Pi solo le da al modelo cuatro herramientas—leer archivos, escribir archivos, modificar archivos y ejecutar comandos.
Si los usuarios necesitan modo de planificación, sub-agentes, MCP, puntos de control de Git o control de permisos, pueden instalarlos gradualmente a través de extensiones y Skills~
Emmm... algo así como entregar primero una casa sin terminar con agua y electricidad completas, Pi se encarga de construir las cuatro paredes, y luego decorarla como un estudio, una sala de juegos o un apartamento de tres habitaciones, depende completamente de lo que el usuario quiera hacer??

Y justo en ese momento, esto chocó con las necesidades de DeepSeek...
Como es sabido, DeepSeek tiene capacidades de razonamiento y programación bastante fuertes, pero la llamada a herramientas, la gestión de contexto y la reproducción del contenido de razonamiento tienen sus propias reglas de interfaz.
Esto hace que al meterlo directamente en un Harness genérico diseñado para OpenAI o Claude, sea fácil encontrar problemas como incompatibilidad de formato de herramientas, errores en la reproducción de contenido de razonamiento y fallos de caché.
Así que, mientras el producto oficial de DeepSeek aún está en camino, Pi tomó la iniciativa y se adaptó—
En abril de este año, Pi agregó soporte nativo para el proveedor de DeepSeek, y también solucionó el error 400 en la reproducción de sesiones de V4.
Conservará el contenido de razonamiento según los requisitos de la interfaz de DeepSeek y mapeará la intensidad de razonamiento interna de Pi al nivel de pensamiento compatible con DeepSeek.
Realmente, también es una adaptación personalizada de la comunidad.
¡Pero! Lo que realmente hizo que Pi y DeepSeek encajaran perfectamente fue la "caché".
Después de todo, cada paso que da un Agente de Codificación implica volver a enviar al modelo las instrucciones del sistema, definiciones de herramientas, historial de conversaciones y código, lo que lleva a que—
A medida que las tareas del modelo se alargan, las solicitudes también se vuelven más largas, y la mayor parte de este contenido, DeepSeek ya lo ha visto antes...
Aquí es donde entra en juego el caché automático de prefijos.
Puede recordar temporalmente el inicio de una solicitud ya calculada. En la siguiente llamada, siempre que las instrucciones del sistema, definiciones de herramientas e historial de conversaciones permanezcan consistentes, este gran segmento de contenido puede reutilizarse directamente, y el modelo solo necesita procesar la nueva información añadida al final.
Y la "tasa de acierto en caché" mide precisamente qué porcentaje de tokens en esta entrada reutilizó con éxito los cálculos previos.
Cuanto mayor sea la tasa de acierto, menos tokens se recalcularán y, naturalmente, menor será el costo de llamada.
Pero el problema también está aquí: un cambio de hora en el prompt, un cambio de orden en las herramientas, y la caché puede olvidarse instantáneamente y recalcular desde cero.
Pero la ventaja de Pi es que es suficientemente simple: herramientas predeterminadas reducidas, contenido de sesión que se agrega continuamente hacia adelante, rara vez se vuelve a modificar el contenido anterior.
De esta manera, DeepSeek, al abrir el registro, puede saltar directamente las cientos de páginas vistas anteriormente y solo procesar las pocas páginas nuevas agregadas al final, ¡reduciendo drásticamente la tasa de fallos de caché!
Justo entonces, el usuario Evan Kim apareció para verificarlo—
La tasa de fallos de caché después de integrar DeepSeek en Pi cayó a solo 0.03%, correspondiente a aproximadamente un 99.97% de tasa de acierto en caché.

Convertido, el costo de procesamiento de 10 mil millones de tokens es de solo alrededor de 19 yuanes; si no se usara caché, el costo sería de más de 900 yuanes...
Además, el equipo de Composio recientemente realizó pruebas comparativas de 8 Harness de Agentes principales, ejecutando directamente DeepSeek V4 Flash en tareas reales.
Después de los resultados, fue un poco dramático, el mismo DeepSeek, con un Harness diferente, ¡¿la diferencia de costo puede llegar a ser de hasta 7 veces?!

A simple vista, efectivamente, Pi Agent tuvo el costo promedio más bajo para completar una tarea exitosa, aproximadamente $0.028 dólares.
Detrás están respectivamente Deep Agents, Hermes Agent, OpenCode, Codex, Oh My Pi y Prime Agent.
Ahora veamos al preciado Claude Code de A社, el indiscutible "participante más caro"—
Completar una tarea exitosa requiere en promedio alrededor de $0.195 dólares, sí, casi 7 veces el precio de Pi... (¡Se derrumba el cielo!)
Por supuesto, esta cifra no significa que Claude Code sea incapaz, después de todo, es en sí mismo un sistema de ingeniería completo construido alrededor del modelo Claude.
Solo significa que cuando el modelo subyacente se cambia a DeepSeek, el flujo de trabajo optimizado originalmente para el ecosistema Claude no aprovecha completamente los beneficios de bajo costo y alta eficiencia de caché de DeepSeek.
El modelo sigue siendo el mismo DeepSeek, Pi solo hace que lea mucho menos contenido que ya ha leído.
Pi: Esperando tranquilamente a que el Harness oficial me supere, ja.
El Harness oficial ya está formando equipo, apuntando directamente a Claude Code
Por supuesto, por muy adecuado que sea Pi para DeepSeek, actualmente sigue siendo una solución de terceros.
Después de todo, DeepSeek mismo también ha decidido entrar personalmente en la fabricación de Harness, e incluso probablemente no falta mucho para su lanzamiento, ¿verdad? (supongo)
En mayo de este año, Chen Deli, investigador senior de DeepSeek, confirmó que la empresa está formando internamente un equipo de Agentes Harness, resumiendo su objetivo con una frase bastante directa—
Comenzar desde cero el desarrollo de DeepSeek Code Harness, comparándose con Claude Code.
Luego, durante estos meses intermedios, los puestos de Gerente de Producto Harness e Ingeniero de Desarrollo también se actualizaron y publicaron masivamente en el sitio web oficial, como:

Luego, a finales de julio, el responsable del equipo de Agentes Harness de DeepSeek, el gran maestro de la medalla de oro ACM Cui Tianyi, todavía estaba reclutando desarrolladores para proyectos relacionados en línea.
También está a punto de llegar a su fin.

Juntando varias pistas, el camino de DeepSeek se está volviendo gradualmente claro.
V4 se encarga de reforzar las capacidades subyacentes de razonamiento, programación y agente; el Harness oficial se encarga de conectar el modelo a terminales, repositorios de código y cadenas de herramientas; la gestión de contexto y la retroalimentación de pruebas pueden devolver casos de fallo de usuarios reales al equipo del modelo.
Por supuesto, para ser honestos, una vez que el producto oficial esté en línea, Pi tampoco perderá su lugar por eso.
DeepSeek Harness se centra en la facilidad de uso y una mayor sinergia con sus propios modelos.
Pi deja la plataforma de trabajo para que el usuario la modifique, más adecuada para desarrolladores a los que les gusta controlar herramientas, personalizar flujos de trabajo y cambiar modelos en cualquier momento.
Después de todo, Pi desde el principio no se limitó solo a DeepSeek...
Claude, OpenAI, Gemini, Kimi, MiniMax, todos estos son compatibles; hoy usa DeepSeek para ahorrar tokens, mañana cambia a otro modelo para manejar tareas especiales, los usuarios pueden cambiar de proveedor en cualquier momento.
Emmm... Esto también significa que, además de los productos al estilo de Claude Code, el Harness oficial de DeepSeek realmente enfrenta plataformas de trabajo abiertas como Pi que ya han sido adaptadas muy cómodamente por los desarrolladores. (doge)
Así que ahora, la presión recae oficialmente en la versión oficial—
¿El Harness que ellos mismos hacen para DeepSeek, no debería ser menos eficiente en ahorrar tokens que el de terceros, verdad?? (doge)
Enlaces de referencia:
[1]https://x.com/composio/status/2086814488162972027?s=20
[2]https://github.com/earendil-works/pi
Este artículo proviene del WeChat público "量子位", autor: Meng Yao







