«En 2-3 meses, Codex será una herramienta primitiva.»
Esta frase no la ha dicho un competidor, sino el propio Thibault Sottiaux, actual Director General de Producto y Plataforma de OpenAI, responsable de ChatGPT y Codex.

Recientemente, el framework Harness ha ido trascendiendo su nicho. Desde desarrolladores hasta trabajadores de oficina, la gente está adoptando estas herramientas de Agente, disfrutando de los beneficios de automatización que aporta la IA. Entre ellas, Codex de OpenAI es una de las más destacadas.
Sin embargo, en este punto, los ejecutivos de OpenAI ya están viendo más allá. El siguiente paso para los agentes de IA (Agents) podría implicar una evolución paradigmática desde pequeñas herramientas de escritorio hacia una «infraestructura nativa de la nube».
Cuando Thibault Sottiaux dice que «los portátiles ya no son suficientes», su mensaje es claro: estamos utilizando Harnesses de escritorio para impulsar la próxima generación de modelos con razonamiento de larga duración y alta autonomía, y este modelo de «zapato grande para un pie pequeño» está llegando a su límite.
Sabemos que los Harness se refieren a los componentes construidos alrededor de un modelo grande para gestionar el contexto, llamar a herramientas, persistir estados, aislar entornos y recuperarse de excepciones. Actualmente, muchos desarrolladores ejecutan tareas de Agente en sus portátiles (por ejemplo, mediante CLI, Cursor, Claude Code o lógicas ligeras de Agente).
Por supuesto, cada vez más desarrolladores tienden a usar múltiples herramientas y modelos juntos: por ejemplo, usar Fable 5 en Claude Code para escribir documentación del proyecto, y luego usar otros modelos en Codex para ejecutar.
Pero esto se encontrará con tres grandes cuellos de botella físicos al enfrentarse a los modelos de próxima generación:
Limitaciones de potencia de cálculo y memoria: cuando un agente necesita ejecutar concurrentemente 20 subtareas (como ejecutar pruebas, extraer datos, compilar un gran proyecto), la memoria, la CPU y los recursos de espacios aislados concurrentes (Docker/VM) del portátil local se saturarán instantáneamente.
Imposibilidad de apagar en tareas largas: las tareas complejas de Agente pueden requerir horas o incluso días de ejecución, exigiendo que el portátil del usuario no se apague, no pierda conexión a internet y no se cierre la tapa, lo cual es muy antinatural desde la perspectiva de la ingeniería.
Explosión paralela de contexto y cadena de herramientas: los modelos de próxima generación sin duda admitirán contextos extremadamente largos y razonamiento altamente concurrente. Los Harness ligeros locales tendrán grandes dificultades para manejar la compresión de contexto, la sincronización de estados y el seguimiento centralizado de registros entre agentes masivamente concurrentes.
Frente a estos desafíos, las señales de que las herramientas de Agente están evolucionando hacia infraestructuras pesadas y diseño de sistemas ya han estado apareciendo gradualmente en los últimos meses.
Por ejemplo, Codex de OpenAI ya ofrece soporte para ejecución asíncrona en la nube. El usuario da una instrucción en la terminal, la tarea se envía a un contenedor aislado (Sandbox Container) en la nube para ejecutarse de forma autónoma, y el teléfono o portátil solo actúa como panel de control.
Al mismo tiempo, están surgiendo micro-espacios aislados nativos de la nube: infraestructuras de espacios aislados ultrarrápidos en la nube diseñadas específicamente para Agentes de IA, como E2B, Daytona, Fly.io, Modal, permiten que un Agente, al ejecutar una tarea, levante dinámicamente cientos de entornos de contenedor independientes para ejecutar código y verificar resultados en paralelo.
Entre los principales equipos de IA, incluidos OpenAI, Anthropic y Cognition, los ingenieros están comenzando a desplazar el foco de su I+D desde la optimización de Prompt hacia la «escritura de Harness a nivel de sistema».
En febrero de este año, el equipo de Anthropic mostró un caso en el que 16 instancias de Claude ejecutándose en paralelo en 2000 sesiones en la nube escribieron un compilador en lenguaje C. Este es un hito para la IA generativa en el campo de la ingeniería de software hacia la colaboración multiagente. En él, diferentes instancias de Claude desempeñaron diferentes roles: 1 Agente arquitecto responsable de diseñar el árbol de sintaxis abstracta (AST), 4 Agentes codificadores responsables de diferentes módulos, dos Agentes de prueba encargados de escribir pruebas unitarias, y 1 Agente auditor responsable de revisar el flujo de código y la seguridad.
El investigador principal Nicholas Carlini señaló: «La mayor parte del esfuerzo se dedicó a crear el entorno para el modelo, las infraestructuras de ciclo cerrado de pruebas y retroalimentación.»
En los próximos dos o tres meses, este tipo de flujos de trabajo de agentes inteligentes podrían convertirse en nuestro día a día.
Combinado con la evaluación de Thibault Sottiaux, el modelo de «control ligero local, ejecución pesada en la nube» se convertirá en estándar. Las interfaces de desarrollador (como IDE, Terminal, Web UI) se transformarán completamente en paneles de control. Las tareas intensivas en cómputo, como la refactorización real de código, la ejecución de pruebas y la automatización/simulación de navegadores, se digerirán en paralelo en clústeres dinámicos en la nube, que luego transmitirán de vuelta al local las diferencias finales (Diff) y los registros.
Y la integración profunda entre modelos y Harness podría cambiar la competencia desde «quién tiene el modelo con mayor capacidad de razonamiento» hacia «quién libera el potencial de su modelo de manera más completa». Aquellos frameworks de Agente que solo dependen de ejecutar scripts Python y simples llamadas API en ordenadores locales están a punto de tocar techo por completo.
Este artículo proviene del WeChat oficial «机器之心» (ID:almosthuman2014), autor: Ze Nan





