Aparece el proyecto más prometedor de DeepSeek: todo puede ser un complemento. Harness no busca imitar a nadie, sino dar el poder de definición a la comunidad de código abierto.
En la tarde del 13 de agosto, DeepSeek finalmente se pronunció, anunciando dos informaciones importantes. La primera es el lanzamiento oficial de DeepSeek V4 Pro, que se actualizó simultáneamente en la aplicación, la web y la API. Los usuarios pueden acceder al nuevo modelo V4 Pro oficial seleccionando el "Modo Experto" en la aplicación o la web; el nombre del modelo en la API permanece sin cambios.
La segunda es que el "Equipo DeepSeek Harness", con un avatar de ballena negra, publicó por primera vez, anunciando la versión preliminar para desarrolladores de Harness, disponible oficialmente y con el código fuente liberado bajo la licencia MIT.
Como se había anunciado anteriormente, la versión oficial de V4 Pro y el Harness desarrollado internamente por DeepSeek se presentaron simultáneamente. Dado que ya nos habíamos enfocado en presentar V4 Pro, este artículo se centrará en analizar por qué DeepSeek Harness es destacable.
Y también, después de hoy, ¿dejará DeepSeek de ser una empresa de modelos para convertirse en una empresa más difícil de definir?
01
El mismo modelo, con otra envoltura, parece otra persona
Para entender por qué Harness es importante, primero hay que comprender un hecho contraintuitivo: en la era de los Agentes, lo que determina si una IA puede trabajar no es solo el modelo.
Los días 6 y 11 de agosto, la empresa de herramientas para Agentes, Composio, intentó demostrar el valor de Harness a través de dos pruebas experimentales. Los investigadores conectaron el mismo modelo DeepSeek V4-Flash a ocho sistemas Harness diferentes (sistemas de ejecución que envuelven al modelo) y les pidieron que completaran treinta tareas de múltiples pasos. Estas tareas no eran preguntas y respuestas, sino que requerían que el Agente accediera a aplicaciones reales como Gmail, Google Calendar, GitHub, Slack, invocara herramientas y cambiara el estado de la aplicación, con cada tarea ejecutándose hasta quince minutos, y se consideraba exitosa solo si pasaba todas las verificaciones.

Los resultados mostraron diferencias considerables. El Pi Agent, que completó más tareas, aprobó veinte, mientras que el OpenCode, el que menos, solo aprobó catorce; de las 240 ejecuciones totales de los ocho Harness, solo 129 tuvieron éxito; de las treinta tareas, solo seis fueron completadas por todos los Harness. En cuanto a costos, para completar las mismas dieciséis tareas, los costos estimados por tarea exitosa para Claude Code, Codex y DeepAgents fueron aproximadamente 0.195 dólares, 0.081 dólares y 0.045 dólares, respectivamente. Para el mismo modelo, la diferencia fue de más de cuatro veces.

Esto significa que el modelo establece el límite superior de la capacidad, pero es el Harness el que determina cuánto de ese potencial se materializa finalmente y a qué costo. Al ejecutar una tarea larga, el sistema de ejecución debe tomar decisiones constantemente: qué conservar y qué descartar del contexto, cuándo invocar qué herramienta, si reintentar o cambiar de enfoque cuando una herramienta falla, si confiar en que el modelo ha terminado o verificar nuevamente. Si alguno de estos pasos no se maneja bien, incluso si el modelo tiene la idea correcta, puede fracasar en el último momento al intentar modificar archivos o enviar código.
Vale la pena mencionar que este es uno de los muy pocos proyectos de DeepSeek que se lanzó con acceso anticipado para pruebas internas antes de su publicación general.
Varios desarrolladores obtuvieron acceso anticipado a Harness antes del lanzamiento. Algunos descubrieron durante las pruebas internas que al hacer que el mismo modelo V4-Flash completara el mismo juego en DeepSeek Harness, Reasonix y Codex, se obtenían resultados completamente diferentes. Esto demuestra que cuando el modelo es idéntico, las herramientas, indicaciones (prompts), organización del contexto y estrategias de ejecución proporcionadas por el sistema de ejecución pueden alterar significativamente el resultado final.
Esta es precisamente la razón por la que DeepSeek valora tanto el desarrollo interno de su propio Harness. Internamente, DeepSeek ha considerado que los Agentes deben resolver el problema del aprendizaje continuo, permitiendo finalmente que la IA acelere el desarrollo de la propia IA. Siguiendo esta línea, Harness no es solo una herramienta de programación adjunta, sino el banco de trabajo desde el cual el modelo aborda tareas de desarrollo reales.
Además, para una empresa que se sustenta en precios bajos y capacidades del modelo, si la entrega de tareas, la retroalimentación de fallos y los puntos de entrada para desarrolladores dependen permanentemente de sistemas ajenos, incluso si tiene ventajas de precio, no podría determinar cuántos tokens se consumen realmente en una tarea, cuántos reintentos se necesitan o cuándo se considera realmente completada.
02
Todo es un complemento: DeepSeek no busca ser un sustituto de nadie
¿Qué es realmente Harness? La descripción más fácil del mercado es "la versión DeepSeek de Claude Code". Pero quienes han probado la versión interna generalmente consideran que esta definición es inexacta.
Según la documentación oficial de DeepSeek, la filosofía central de diseño de Harness es "Todo es un complemento" (Everything is a plugin). Está construido sobre el sistema de complementos Cordis, donde modelos, herramientas, habilidades, sesiones, sandboxes, almacenamiento, bucles, programación, interfaz de usuario... todas las capacidades del Agente se componen mediante complementos. Los desarrolladores no necesitan modificar el código fuente de Harness para seleccionar, reemplazar o extender cualquier capacidad mediante configuración.

Esto no está al mismo nivel que lo que normalmente se entiende por complementos. Los complementos de VS Code agregan funcionalidad al editor; los complementos de Codex agregan herramientas al Agente. Pero los complementos de Harness pueden reemplazar el cerebro del Agente, su caja de herramientas, sus reglas e incluso toda su interfaz.
Según múltiples personas que participaron en las pruebas internas, durante ese período los desarrolladores se volvieron locos creando complementos. "La gente ni siquiera probaba bien, se ponía a escribir complementos", y en solo unos días aparecieron cientos de complementos. Alguien modificó completamente la interfaz de trabajo; alguien implementó puramente con complementos una "memoria a largo plazo entre sesiones más autoevolución en segundo plano", haciendo que el modelo periódicamente revise sus propios registros de trabajo y comprima experiencias temporales en conocimiento duradero.
Otros comentaron que la gobernanza de la comunidad de código abierto también podría ser un desafío que DeepSeek deberá enfrentar próximamente.
Otro diseño clave es la trazabilidad. Harness utiliza registros de sesión de solo adición (append-only). Todo lo que el modelo ve -indicaciones del sistema, cadena de pensamiento (chain of thought), invocaciones de herramientas y resultados, programación de subagentes, cada inyección de contexto- se registra completamente. La compresión del contexto no elimina el historial original, solo cambia la apariencia que el modelo ve a partir de ese momento mediante eventos de reemplazo. Los desarrolladores pueden rastrear el origen en la vista Trajectory, que permite restaurar, bifurcar, buscar y reproducir. La documentación oficial resume este principio como "Lo que el modelo ve, ya está registrado".
Detrás de esto hay un pensamiento típico de ingeniería de sistemas. Según los informes, el líder del equipo DeepSeek Harness, Cui Tianyi, se graduó en Informática de la Universidad de Zhejiang, trabajó nueve años en la firma de trading cuantitativo Jane Street y se unió a DeepSeek en marzo de 2026; Harness se convirtió en un proyecto interno en mayo. La ventaja central de los sistemas de trading de alta frecuencia nunca ha sido lo inteligentes que son sus estrategias, sino la ejecución estable en entornos extremadamente complejos, la gestión de excepciones, el registro completo y trazable, y el control de riesgos; precisamente la pieza que más falta para que los Agentes de IA pasen de demostraciones a producción. Algunos desarrolladores de las pruebas internas lo describieron como "tan estable como un perro viejo" al ejecutar tareas largas: si la tarea se interrumpe, se guarda automáticamente y se puede continuar después, sin necesidad de empezar desde cero.
Es importante señalar que Harness no se encierra dentro de los muros de los modelos de DeepSeek. Es compatible por defecto con la conexión a casi cuarenta modelos grandes, incluidos Kimi, OpenAI, Anthropic, Google, entre otros. Quizás otros prefieren crear un Agente listo para usar, pero DeepSeek Harness se parece más a un conjunto de componentes; los desarrolladores pueden decidir por sí mismos cómo debe ser el Agente y cómo debe funcionar.
Por supuesto, los desarrolladores mantienen la prudencia. El anuncio indica que, como versión preliminar temprana, "aún hay muchos detalles por mejorar y pulir, y los complementos principales e interfaces básicas también evolucionarán rápidamente en el futuro". De hecho, uno de los medios que participó en las pruebas internas, ifanr, comentó que era difícil imaginar que DeepSeek, conocido por su rapidez, alguna vez tardara más de media hora en ejecutar una tarea de programación. El número de versión v0.1 también indica que esta ballena negra acaba de emerger y está lejos de nadar libremente.

03
De vender Tokens a entregar resultados: la ambición de la Ballena Negra
La aparición de Harness coincide con un cambio de dirección en toda la industria de la IA.
En los últimos años, la competencia entre las empresas de modelos grandes se centró en la escala de parámetros y los puntajes de referencia. Pero al entrar en 2026, las capacidades básicas de los modelos principales convergen rápidamente, las diferencias en respuestas individuales se reducen constantemente y la guerra de precios se intensifica. El modelo de negocio de simplemente vender Tokens tiene un límite visible. La industria gradualmente se da cuenta de que el valor central de la industria de la IA no está en la salida del modelo, sino en su aplicación en escenarios reales: con el mismo consumo de Tokens, charlas casuales tienen poco valor, mientras que corregir un error o completar el desarrollo de una funcionalidad puede crear un valor comercial varias veces mayor.
El nuevo lanzamiento de DeepSeek significa su transición de vender potencia de cálculo a entregar resultados. En el modelo antiguo, los clientes pagaban por el volumen de invocaciones de Tokens, independientemente de si el modelo realmente resolvía el problema; en el nuevo modelo, el punto de referencia del pago cambia de cuánto cálculo se consumió a qué tarea se completó.
Esta publicación de DeepSeek Harness también fue muy bien recibida por los desarrolladores por otra razón. DeepSeek no define al Agente en sí mismo, sino que utiliza la capacidad de difusión de la comunidad de código abierto para promover un enfoque Harness. Este es un camino más ambicioso y también más difícil.
Además, Harness se enfrenta a un mercado maduro ya validado por Claude Code y Codex, estos últimos respaldados por los recursos de iteración de modelos y comerciales de Anthropic y OpenAI, con claras ventajas por haber llegado primero. Después de abrir el código, quedan preguntas sin resolver: ¿el ecosistema de complementos florecerá espontáneamente?, ¿estarán los desarrolladores dispuestos a confiar sus entornos de producción a una versión 0.1?, ¿pueden los hábitos de pago del mercado local soportar la nueva lógica de "pago por resultados"? DeepSeek también ha indicado que los complementos principales y la API seguirán evolucionando rápidamente, lo que significa que quienes se integren temprano deberán asumir el costo de los cambios en las interfaces.
El 13 de agosto, hubo dos publicaciones en lados opuestos del Pacífico. Musk presentó Grok 4.6, calificándolo de "inteligente, rápido y de muy buena relación calidad-precio"; DeepSeek no dijo nada, simplemente siguió lanzando actualizaciones.
Entre el alboroto y el silencio, hay una divergencia de dos filosofías comerciales.
Queremos llamarlo el "proyecto con mayor potencial en la historia de DeepSeek", no porque hoy sea ya el más fuerte. V4 Pro aún tiene diferencias con los modelos state-of-the-art (sota), Harness es solo una versión preliminar v0.1 para desarrolladores, la reacción del mercado tras el aumento de precios está por verse, y la construcción del ecosistema es un largo camino. El potencial es precisamente eso porque aún no se ha materializado.
Pero si extendemos la línea de tiempo, desde R1 hasta V4, desde modelos hasta Harness, cada paso que DeepSeek ha dado va en la misma dirección: llevar capacidades de vanguardia a un costo asequible, y luego conectar esas capacidades asequibles a sistemas aplicables en la práctica.
La ballena negra ya ha emergido. En cuanto a qué tan lejos puede nadar, está en el futuro que pertenece a la comunidad de código abierto.
Este artículo proviene del WeChat public account "Phoenix Network Technology" (凤凰网科技), autor: Dale, editor: Dong Yuqing







