Claude termina el código y no lo entrega directamente: pasa por 4 Skills de autoverificación, lo corrige y luego vuelve a buscarte

marsbit发布于2026-07-27更新于2026-07-27

文章摘要

Anthropic ha introducido una innovación clave en Claude Code: los "bucles de verificación". En lugar de entregar código directamente, Claude ahora ejecuta automáticamente cuatro verificaciones en bucle antes de considerar completada una tarea: `/code-review` para detectar bugs, `/simplify` para limpiar implementaciones redundantes, `/verify` para una validación de extremo a extremo, y `/design` (cuando se modifica la UI) para comprobar la coherencia visual con las especificaciones. Esto traslada el cuello de botella del desarrollo de "escribir código" a "verificar que el código sea correcto", permitiendo que los agentes de IA funcionen de manera más autónoma y prolongada. La clave está en encapsular los pasos de verificación manual repetitiva en "Skills" personalizables (módulos reutilizables que contienen instrucciones, flujos de trabajo y configuraciones). Los usuarios pueden crear sus propios Skills documentando sus reglas de revisión específicas. La automatización puede configurarse en cuatro niveles: manual (Standalone), integrada en un flujo (Embedded), encadenada (Chained) o ejecutada en cada Pull Request (On every PR). Este enfoque marca un cambio en la competencia de la programación con IA, que evoluciona de la generación de código hacia su verificación automática. Skills se está convirtiendo en un estándabierto adoptado por varias herramientas, lo que permite que el conocimiento y los flujos de trabajo del equipo sean portables y no dependan de un solo proveedor....

Escribir código, eso ya lo hace la IA por ti. Pero revisarlo, eso aún recae sobre tus hombros.

Si un código está bien escrito o no, la IA no se hace responsable, al final tienes que revisarlo línea por línea tú mismo: este obstáculo ha atascado a mucha gente.

Recientemente, Anthropic también ha integrado la verificación por IA en el ciclo.

Han hecho que Claude, después de escribir el código, no lo entregue directamente, sino que continúe ejecutando cuatro comprobaciones:

/code-review para detectar bugs primero, /simplify para limpiar la implementación redundante, /verify para hacer una verificación de extremo a extremo, y si esta vez se modificó la interfaz, usar /design para verificar el aspecto visual contra DESIGN.md.

Después de pasar estas cuatro comprobaciones, se considera entregado.

El 22 de julio, el equipo de Claude Code hizo público este "ciclo de verificación" interno.

En otras palabras, después de que Claude escribe el código, primero busca errores por sí mismo, los corrige hasta que no haya problemas y luego vuelve a buscarte.

Esto significa que la IA ha comenzado a evolucionar desde "saber escribir código" hasta "saber verificar el código que escribe".

El ciclo de trabajo del agente inteligente, ahora incluye una verificación

Anthropic le ha dado un nombre a esto: ciclo de verificación (verification loop).

La definición oficial es simple: es un proceso iterativo en el que Claude verifica e intenta corregir su propio trabajo.

Lo que modifica es el ciclo de trabajo del agente inteligente.

Antes era "recopilar contexto → ejecutar acción → verificación manual", donde el último paso recaía en la persona: la IA entregaba el trabajo y tú tenías que revisarlo línea por línea.

Ahora esta línea se ha alargado a "recopilar contexto → ejecutar acción → verificación automática → corrección → nueva verificación". La verificación y la corrección se han reintegrado en el ciclo.

Diagrama del ciclo del agente inteligente oficial de Anthropic: después de recibir la instrucción, Claude recopila el contexto, ejecuta la acción, verifica el resultado; si la verificación falla, se devuelve para volver a ejecutar, y solo se devuelve si pasa.

Algunas comprobaciones Claude ya las hace. Señales deterministas en el repositorio de código, como el verificador de tipos, el linter, ejecutar pruebas, errores en tiempo de ejecución, puede leerlos y también corregirlos sobre la marcha.

Lo realmente problemático es otro tipo: si la interfaz se modificó correctamente, si el flujo del usuario es fluido, si este cambio ha dejado fallos ocultos...

Esto antes solo podía confiarse a la supervisión humana, realizando las mismas comprobaciones docenas o cientos de veces.

La solución de Anthropic es escribir una a una esas comprobaciones que siempre tienes que hacer manualmente, encapsularlas en Skills y dárselas a Claude para que las ejecute automáticamente en cada tarea.

En las últimas décadas, todos los procesos de ingeniería de software: escribir requisitos, planificar, revisiones por capas, interminables reuniones, en esencia se deben a que: escribir código es demasiado lento, el tiempo de los ingenieros es demasiado valioso.

Pero cuando la IA hace que escribir código sea más rápido y barato, esta premisa deja de existir.

El propio juicio del equipo de Claude Code es: el cuello de botella no ha desaparecido, solo se ha trasladado: de "escribir código" a la verificación, revisión de código, seguridad y otros aspectos.

El código se genera demasiado rápido, y el nuevo problema se convierte en si ese código es correcto, quién lo mantiene y si las personas pueden seguir el ritmo de revisar el código.

Ante este nuevo cuello de botella, el equipo de Claude Code primero experimentó consigo mismo.

Los 4 Skills de autoverificación que el equipo de Claude Code usa diariamente

Internamente, el equipo de Claude Code usa diariamente estos cuatro Skills de autoverificación.

/code-review, revisa específicamente los cambios en el código, detecta posibles bugs y, de paso, da una opinión de revisión.

Esto equivale a tener un revisor incansable a tu disposición.

/simplify, limpia el diff de esta modificación, elimina implementaciones complejas y enrevesadas, haciendo la estructura más simple.

No añade funciones, sino que elimina redundancias, simplifica la implementación, reduciendo los costes de mantenimiento futuros.

Esto es muy importante y demuestra gran habilidad. La mayoría de la gente escribe código acumulando, una herramienta que activamente hace reducción es especialmente valiosa.

/verify, realiza una verificación de extremo a extremo, la ejecuta de verdad, confirmando que la funcionalidad realmente se ha completado, y no solo "parece completada".

/design, solo entra en acción cuando se modifica la interfaz de usuario. Verifica punto por punto contra el DESIGN.md en el repositorio si tu implementación visual se ha desviado.

Estos 4 Skills no han surgido de la nada.

En su base, Claude Code ya ha establecido una capa de soporte de verificación lista para usar:

El /verify incorporado puede ejecutar la aplicación para observar cambios, tú escribes claramente los comandos de construcción y prueba en CLAUDE.md, y él los ejecuta; también hay Code Review específico para revisiones multiagente en PRs, y GitHub Actions que se disparan automáticamente en cada commit.

Los 4 Skills del equipo equivalen a añadir su propio proceso adicional sobre esta base genérica.

¿Cómo escribir tu propio Skill de verificación?

El método que da Anthropic también es simple:

Escribe con palabras sencillas ese paso que siempre tienes que hacer manualmente, como si le estuvieras explicando las precauciones a un nuevo compañero en su primer día.

Si te atas incluso al describir cómo debe ser esta comprobación, primero puedes pedirle a Claude que dé una versión de mejores prácticas genéricas y luego modificarla.

Es muy probable que tu versión difiera de la práctica genérica en algunos puntos, y esas diferencias son precisamente lo que más debe registrarse.

La verificación tampoco tiene que ser necesariamente un juicio vago como "sentir si está bien".

Por ejemplo: cualquier cambio que elimine un campo de la base de datos pero no tenga pasos de migración de datos asociados, será rechazado. Esta es una "regla local" que un linter genérico nunca captará, pero es exclusiva de tu proyecto.

Cualquier línea roja que solo hayas podido mantener mediante supervisión manual, merece la pena escribirla como un ciclo.

¿Y después de escribirla?

Dásela a skill-creator para que te haga algunas preguntas inversamente, o simplemente añade un archivo Markdown en .claude/skills/.

El Skill de verificación más simple son unas pocas líneas de explicación y un párrafo de texto. Luego llámalo en una nueva tarea, confirma que esta comprobación realmente se ejecuta, y si no, corrígelo.

Para esos Skills que no puedes modificar, como los incorporados o gestionados por plugins, también hay una solución: escribe un Skill envoltorio (wrapper) que llame primero al original y luego a tu verificación. Rodéalo, e igualmente integra la comprobación.

La verificación no es de talla única, tiene 4 niveles

Después de encapsular la comprobación en un Skill, la siguiente pregunta es: ¿cuándo se activa esto?

Anthropic da 4 niveles de automatización, de más flexible a más estricto.

Standalone: Tú mismo lo recuerdas y lo llamas manualmente.

Embedded: Integrado en el flujo de una tarea, se ejecuta junto con ella.

Chained: Varios Skills de verificación encadenados en una cadena, se ejecutan automáticamente uno tras otro.

On every PR: El nivel más duro, cada vez que se envía código pasa automáticamente por él.

La transición intermedia, oficialmente la llaman "del hábito al contrato".

Lo que antes era el hábito personal de "siempre recuerdo ejecutar /verify después de /simplify", después de encadenarlo, se convierte en el contrato fijo de "después de ejecutar /simplify, automáticamente se llama a /verify".

Toda la cadena recorre el ciclo de desarrollo por sí misma, y solo vuelve a buscarte cuando necesita tu aprobación.

Cuanto más larga es la cadena, mayor es la fiabilidad, pero oficialmente advierten específicamente: la verificación en cadena consume tokens de verdad.

Así que no establezcas desde el principio todas las comprobaciones como puerta de PR, que bloquee cada envío. La postura correcta es primero ver si es estable, y luego añadir gradualmente.

Detrás de los 4 Skills, la programación con IA está cambiando de carril

Detrás de los 4 Skills, la competencia en programación con IA está pasando de la generación a la verificación.

El padre de Claude Code también ha dado el mismo juicio.

El 9 de junio de este año, tuiteó: En la era en que los modelos potentes pueden ejecutarse de forma autónoma durante largos periodos, la autoverificación es clave para que el modelo se ejecute durante más tiempo y los resultados se acerquen más a tus expectativas: no tienes que estar frecuentemente supervisando a Claude, y puedes confiarle más trabajo.

En pocas palabras, cuanto más sólida sea la verificación, más libertad tendrá el agente para ejecutarse; cuanto más tiempo se ejecute, más tranquila estará la persona.

Antes confiábamos en las instrucciones (prompts), pero también tienen un límite: solo resuelven la tarea de esta vez, la próxima hay que empezar de nuevo.

Aquí primero corrijamos un malentendido común: un Skill no es un prompt en Markdown.

Es un módulo de capacidad, que contiene instrucciones, estructura de archivos, scripts, llamadas a herramientas, configuración y un conjunto completo de flujos de trabajo. Es la sedimentación de los pasos de verificación del equipo, normas de diseño, errores cometidos, en un paquete disponible a demanda, que Claude consulta por sí mismo cuando lo necesita.

Lo más crucial es que los Skills están pasando de ser una característica de Claude Code a un estándar abierto entre fabricantes.

Según el análisis de la industria, GitHub Copilot, Cursor, OpenAI Codex, Gemini CLI ya han adoptado el mismo formato.

Esto significa que los Skills que sedimentas para tu equipo no quedarán encerrados en una sola herramienta, sino que sedimentarán la experiencia, normas y procesos de verificación del equipo, convirtiéndose en una capacidad reutilizable.

Esto también lleva a una realidad punzante: el mismo Claude, utilizado por diferentes equipos, puede tener una eficiencia varias veces diferente. La causa de esta diferencia no está en el modelo, sino en el flujo de trabajo:

Si has escrito las comprobaciones como Skills, si has establecido ciclos de verificación, si has hecho que el agente inteligente cierre él mismo el ciclo de retroalimentación.

En definitiva, la capacidad del agente inteligente es una suma: modelo, más herramientas, más mecanismo de verificación, más flujo de trabajo.

El modelo, en este aspecto, cada vez es más similar entre todos. Lo que realmente marca la diferencia son los otros tres aspectos, y todos ellos están en manos del usuario.

Por supuesto, lo que muestra este blog es la optimización del flujo de desarrollo asistido por IA, no que "la IA ya pueda escribir software de forma independiente". Aún depende de los ingenieros y no puede hacer entregas a nivel de producción sin intervención humana.

Por lo tanto, no es que los agentes inteligentes vayan a quitar el trabajo a los ingenieros humanos, pero la dirección ya es clara.

Antes, siempre estábamos enseñando a la IA cómo escribir código, ahora hay que empezar a enseñarle a verificar si lo que escribe está bien.

Para alguien que usa la IA a diario para escribir código, el día en que finalmente pueda confiar con tranquilidad a la IA esa tarea de "tener que revisar manualmente antes de salir del trabajo", entonces realmente comenzará a hacer el trabajo por ti.

Referencias:

https://claude.com/blog/building-verification-loops-in-claude-code-with-skills

https://claude.com/blog/getting-started-with-loops?utm_source=chatgpt.com

Este artículo proviene del WeChat público "新智元" (Nueva Era de la Inteligencia), autor: ASI启示录

热门币种推荐

相关问答

Q¿Qué es el 'verification loop' que ha implementado Claude Code según el artículo?

AEs un proceso iterativo donde Claude revisa e intenta corregir su propio trabajo automáticamente, en lugar de entregar el código directamente. Incluye cuatro pasos principales: /code-review para encontrar errores, /simplify para limpiar implementaciones redundantes, /verify para una validación de extremo a extremo y /design para revisar cambios visuales contra DESIGN.md.

Q¿Cuáles son los cuatro 'Skill' (habilidades) de autoverificación que el equipo de Claude Code utiliza internamente?

ALos cuatro Skill son: 1) /code-review para detectar errores potenciales, 2) /simplify para limpiar el código complejo o redundante, 3) /verify para ejecutar pruebas de extremo a extremo y confirmar la funcionalidad, y 4) /design (cuando se modifica la interfaz) para verificar que los cambios visuales cumplan con las especificaciones de DESIGN.md.

QSegún el artículo, ¿qué significa que un Skill no es solo un prompt de Markdown?

AUn Skill es un módulo de capacidad que contiene instrucciones, estructura de archivos, scripts, llamadas a herramientas, configuración y un flujo de trabajo completo. Es la forma de encapsular y reutilizar los pasos de verificación, normas de diseño y lecciones aprendidas por un equipo, haciéndolo un paquete de conocimientos accesible para Claude y transferible entre herramientas.

Q¿Qué cuatro niveles de automatización describe Anthropic para activar un Skill de verificación?

ALos cuatro niveles son: 1) Standalone (se invoca manualmente), 2) Embedded (se ejecuta automáticamente dentro de un flujo de tareas específico), 3) Chained (varios Skills se ejecutan en cadena, uno tras otro) y 4) On every PR (se ejecuta automáticamente en cada solicitud de cambios).

Q¿Por qué el artículo sugiere que la competencia en la programación con IA está cambiando de la generación a la verificación?

APorque la generación de código se ha vuelto rápida y barata, desplazando el cuello de botella a la verificación, revisión y mantenimiento del código producido. La capacidad de un agente de IA para auto-verificarse de forma sólida permite que funcione de manera más autónoma y prolongada, liberando a los ingenieros humanos de tareas de revisión manual repetitivas.

你可能也喜欢

帕克·刘易斯解释为何比特币仍是最佳货币

知名比特币分析师帕克·刘易斯在访谈中批评了某些上市公司以“数字信贷”形式销售永续优先股的营销策略,认为这从根本上扭曲了比特币的本质。他指出,比特币在算法层面不具备法币收益性,承诺定期分红主要依赖牛市吸引新投资者来维持,风险极高。 刘易斯引用数据说明此类衍生品的巨大风险:全球信贷市场规模达300万亿美元,而永续优先股市场仅约1万亿美元,这表明机构有意规避这种无还款期限的资产,将风险转嫁给信息不足的散户。 针对“比特币波动性太大”的常见观点,他认为波动性是这一供应量严格受限的新资产被大规模采用过程中的自然数学结果。新人入场需出更高价从早期持有者手中购买,导致价格剧烈波动。他建议投资者直接持有比特币,这比投资MicroStrategy等公司发行的衍生品更安全。 投资者将焦点从直接持有加密货币转向公司衍生品,会忽视法币急速贬值的真正威胁。刘易斯以自创的“肋眼牛排指数”为例,指出其本地超市一款牛排价格从2020年的19.99美元涨至37.99美元,反映年化约12-13%的真实通胀,远超官方平滑后的CPI数据。 在全球通胀环境下,最明智、保守且安全的策略仍是直接持有比特币并完全掌控私钥。追逐加密货币国库股等公司工具的收益只会叠加隐性系统风险,而理解去中心化货币的本质才能有效保护财富免受宏观经济动荡影响。

cryptonews.ru2小时前

帕克·刘易斯解释为何比特币仍是最佳货币

cryptonews.ru2小时前

比特币为何在美联储强硬暂停后守住 64,000 美元关口

比特币在美联储暂停加息后维持在64,000美元附近,结束了7月的交易。市场对美联储维持利率不变的决定反应剧烈,但并未获得政策即将转向的明确信号。在此背景下,资金重新流入比特币现货ETF,加密货币总市值保持在2.29万亿美元左右,主要山寨币走势分化。 投资者目前处于观望状态。一方面,高利率和美联储的强硬立场抑制了风险偏好;另一方面,市场未出现恐慌性抛售、比特币ETF恢复资金净流入以及关键价位的韧性表明,数字资产市场尚未准备好大幅下跌。 **关键信息:** - 美联储维持利率在3.50%-3.75%,投票结果为9:3,三位委员支持加息。 - 比特币现货ETF净流入3210万美元,结束了连续流出;以太坊ETF则净流出约1865万美元。 - 比特币在63,000-66,000美元区间内盘整,63,000-63,500美元构成支撑,66,000美元是近期阻力。 - 以太坊价格在1,900美元附近承压,但其网络基本面(如质押意愿)保持稳定。 - 资金在主要加密货币间轮动,比特币重获机构青睐,Solana相关产品也有资金流入。 - 美国CLARITY Act法案审议被推迟至秋季,降低了其在2026年内通过的可能性。 技术层面,比特币能否在63,000美元上方保持稳固、以太坊能否守住1,860美元以及机构资金流入能否持续,被视为市场能否在2026年下半年构筑复苏基础的关键信号。

cryptonews.ru2小时前

比特币为何在美联储强硬暂停后守住 64,000 美元关口

cryptonews.ru2小时前

交易

现货

热门文章

如何购买4

欢迎来到HTX.com!我们已经让购买4(4)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买4(4)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的4(4)购买完您的4(4)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易4(4)在HTX的现货市场轻松交易4(4)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

1.7k人学过发布于 2025.10.20更新于 2026.06.02

如何购买4

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对4(4)币价的意见。

活动图片