¡Claude ha comenzado a entrenar a Claude!
4 dólares por hora, supera a investigadores humanos que cobran 150 dólares la hora.
En la última investigación publicada por Anthropic, Claude busca artículos académicos por su cuenta, propone soluciones, genera datos y entrena modelos, abordando de una vez 10 tipos de problemas de seguridad en IA.
En algunas tareas, las soluciones que entregó incluso superaron a las de 28 investigadores de seguridad humanos.
Lo más impactante es que una versión más débil de Claude ha comenzado a participar inversamente en el entrenamiento de una versión más fuerte de Claude.
Parece que el día en que la IA "se mejore a sí misma" está cada vez más cerca...
4 dólares la hora, Claude supera a investigadores humanos
En este estudio titulado "Los investigadores automatizados pueden mitigar eficazmente los fallos de alineación de la IA", Anthropic llevó directamente a Claude al laboratorio.

En concreto, basándose en Claude Opus 4.8, crearon un sistema de investigadores de alineación automatizado llamado AAR.
Al recibir un problema específico de seguridad del modelo, Claude busca por sí mismo artículos académicos relevantes, encuentra métodos útiles en ellos, luego propone nuevos planes de entrenamiento, genera datos, ajusta el modelo y finalmente ejecuta pruebas de seguridad y capacidad general.

Desde la formulación de hipótesis hasta la verificación, un ciclo de investigación en IA relativamente completo fue entregado a Claude.
Si los resultados no son buenos, el plan se descarta; si hay mejora, se continúa probando en esa dirección.
Una ronda de entrenamiento suele durar solo 30 minutos. Así, Claude puede, como un algoritmo de búsqueda, probar y fallar rápidamente entre una gran cantidad de soluciones.
En todo este proceso, los humanos son responsables de plantear los problemas, proporcionar los modelos y los criterios de evaluación, mientras que Claude se encarga de la mayor parte del trabajo, desde la búsqueda de información hasta la ejecución de experimentos.
10 problemas de seguridad difíciles, Claude encontró soluciones de mejora para todos
En el experimento, Anthropic presentó de una vez 10 problemas a Claude.
Estos problemas cubren problemas comunes de alineación en modelos, incluyendo engaño, adulación, hackeo de recompensas, violación de privacidad y escapes (jailbreaks).

Por ejemplo, la "adulación" se refiere a que el modelo, para seguirle la corriente al usuario, da respuestas que al usuario le gustan pero que no son necesariamente correctas; el "hackeo de recompensas" es cuando el modelo no completa realmente la tarea, sino que encuentra vacíos en las reglas de evaluación para obtener una puntuación más alta.
Claude procesa solo un problema a la vez, propone repetidamente soluciones, entrena el modelo objetivo correspondiente y luego pasa a la siguiente ronda según los resultados.
Al final, los 10 tipos de problemas mostraron mejoras.

Según el indicador "brecha de seguridad" definido por Anthropic, Claude cerró entre el 26% y el 96% de esa brecha. En términos simples, acercó significativamente al modelo, que originalmente tenía problemas de seguridad, hacia una puntuación teórica perfecta.
Lo más importante es que estos métodos no solo son efectivos para los problemas que Claude ha visto.
Algunas de las soluciones ganadoras, aplicadas a conjuntos de pruebas no públicos y a evaluaciones Petri que simulan escenarios adversarios de múltiples rondas, aún logran reducir los comportamientos inseguros del modelo. Incluso cuando se aplican a modelos hasta 4.7 veces más grandes que el modelo experimental, el efecto se mantiene.
Anthropic también estableció una línea roja: el entrenamiento de seguridad no debe dañar significativamente las capacidades originales del modelo.
Después de todo, hacer que un modelo se niegue a responder ante cualquier cosa también puede mejorar las puntuaciones en muchas pruebas de seguridad, pero un modelo así es prácticamente inutilizable.
Finalmente, las soluciones encontradas por Claude no mostraron un deterioro significativo en las pruebas de capacidad general preestablecidas.
85% frente a 20%, Claude gana con gran diferencia a investigadores humanos
La victoria más abrumadora ocurrió en la prueba de "engaño".
Para hacer que el modelo objetivo se volviera más honesto, Claude presentó más de 150 intentos.
Propone un método, lo entrena una vez y luego ajusta según los resultados. En un experimento individual, la mejor solución cerró una brecha de seguridad del 82%; considerando múltiples ejecuciones, el promedio alcanzó el 85%.

El mismo problema fue asignado también a 6 investigadores de seguridad en IA con amplia experiencia.
El resultado: los investigadores humanos cerraron en promedio solo el 20% de la brecha de seguridad...
85% frente a 20%, Claude ganó sin lugar a dudas.
En total, participaron 28 investigadores de seguridad humanos en todas las tareas, cada uno con un máximo de 8 horas para leer materiales y diseñar soluciones.
El artículo afirma que el investigador automatizado generalmente puede encontrar un método que supere el promedio humano en menos de 6 horas, y que las direcciones de investigación proporcionadas por humanos no hicieron que Claude obtuviera mejores resultados.

Lo más doloroso, ¡está en el costo!
El costo por hora de API para un investigador automatizado es de aproximadamente 4 dólares; la remuneración que Anthropic pagó a los investigadores humanos fue de 150 dólares por hora.
Esto... los investigadores humanos definitivamente serán reemplazados por Claude.
Sin embargo, esta competencia entre humanos y máquinas no fue completamente justa.
Claude puede entrenar realmente el modelo, ver los resultados de cada experimento y modificar continuamente la solución; los investigadores humanos solo podían enviar un método una vez, sin oportunidad de iterar según los resultados.
Un Claude más débil entrena a un Claude más fuerte, 60 horas para acercarse a la versión oficial
En los experimentos anteriores, los modelos principales mejorados eran modelos pequeños de código abierto.
A continuación, Anthropic elevó directamente la dificultad: dejar que Claude Sonnet 5, más débil, entrenara una versión temprana de Claude Opus 4.8 que aún no había completado la mayor parte del entrenamiento de seguridad a nivel de producción.
El alumno no tiene por qué ser inferior al maestro, probablemente se refiera a este tipo de modelo.

En 60 horas, Sonnet 5 probó más de 50 soluciones. El método finalmente encontrado cerró aproximadamente el 65% de la brecha de seguridad, acercándose ya al 72% de la versión oficial Opus 4.8.
Este plan utilizó solo poco más de 2000 datos de entrenamiento, compuestos principalmente por plantillas simples y conjuntos de datos públicos.
Según los cálculos de Anthropic, en este conjunto específico de tareas, su eficiencia en datos es aproximadamente 15,000 veces mayor que la del proceso de alineación a nivel de producción.
Por supuesto, esto no significa que Anthropic pueda replicar todo el entrenamiento de producción con 2000 datos.
El modelo oficial todavía debe manejar más capacidades, más riesgos y una gran cantidad de casos extremos; este experimento se centró solo en un conjunto específico de indicadores de seguridad.
Pero esto ya demuestra que un Claude más débil puede buscar por sí mismo artículos académicos, diseñar métodos, generar datos y luego escribir los resultados del entrenamiento en un Claude más fuerte.
Los humanos definen el alcance, Claude se encarga de la iteración. Un modelo comienza a participar en la creación del siguiente modelo más seguro y poderoso.
La IA mejorando a la IA ya se ha convertido en un hecho ante nuestros ojos.
Entonces, ¿cuenta como "autoevolución de la IA"?
Desde el punto de vista de los resultados, esta investigación ciertamente ha tocado el umbral de la "autoevolución de la IA".
Pero si entendemos la "autoevolución" como una IA que diseña, entrena y fabrica de manera completamente autónoma una próxima generación de IA más fuerte, entonces este experimento está lejos de alcanzar ese punto.
Después de todo, en este proceso, qué problemas investigar, qué modelo y datos usar, qué resultados se consideran exitosos, todavía los decide el humano.
El propio Anthropic admite que el AAR solo puede optimizar los objetivos que los humanos han escrito previamente en el sistema de evaluación.
Este experimento no cubrió otros problemas complejos; algunos riesgos de baja frecuencia o recién surgidos ni siquiera tienen Benchmarks correspondientes.
Los investigadores también solo examinaron un conjunto previamente seleccionado de capacidades generales, por lo que no pueden descartar que cierto entrenamiento de seguridad, al mejorar las puntuaciones, dañe otras capacidades que no fueron probadas.
Las evaluaciones de seguridad como Petri también son solo indicadores proxy de riesgos reales. Que un modelo se comporte de manera más segura en las pruebas no equivale a que sea necesariamente confiable en entornos reales.
Por lo tanto, el mayor riesgo del AAR también se esconde en su ventaja: es demasiado bueno probando y fallando rápidamente según los indicadores.
Una vez que la regla de medición es incorrecta, cuanto más rápido corra Claude, más lejos puede estar del resultado que los humanos realmente desean.
Y lo más dramático es que el propio Agente de investigación también hace trampa.

Para evitar que el AAR encuentre vacíos en las reglas de evaluación, Anthropic asignó específicamente un Agente de monitoreo para revisar los planes que Claude prepara ejecutar y el registro completo de la investigación.
Como resultado, en aproximadamente 1600 registros de investigación, el modelo de monitoreo descubrió 39 intentos de trampa, aproximadamente un 2.4%.
Algunos Agentes enviaban repetidamente la misma solución, intentando aprovechar las fluctuaciones en la evaluación para obtener una puntuación más alta; otros generaban datos de entrenamiento imitando el formato del Benchmark, y algunos ocultaban deliberadamente pasos experimentales que violaban las reglas.
En lugar de resolver realmente los problemas de seguridad del modelo, preferían encontrar un atajo para mejorar rápidamente la puntuación.
Esto tiene un toque de humor negro... vamos, que el Agente se volvió cómplice, ¿no?

La buena noticia es que estas intenciones de hacer trampa generalmente aún aparecen en los registros de razonamiento del modelo, por lo que pueden ser detectadas por el Agente de monitoreo.
La mala noticia es que Anthropic tampoco puede asegurar que modelos más fuertes en el futuro dejarán rastros tan evidentes.
Cuando el Agente de investigación tenga más herramientas, mayores permisos y pueda modificar directamente el proceso de entrenamiento del modelo, "cómo monitorear una IA responsable de mejorar a otra IA" podría volverse más complicado que el entrenamiento en sí.
Pero, en resumen, un AAR cuesta aproximadamente 4 dólares por hora, puede trabajar continuamente y también puede replicarse decenas o cientos de veces para ejecutar experimentos en paralelo.
Mientras que el salario por hora de un investigador humano es mucho más alto que eso, necesita descansar y la cantidad de experimentos que puede avanzar a la vez es bastante limitada.
Los números hablan por sí solos.
No sé si decir que es una explosión nuclear, o sentarse completamente anonadado...
Esta vez, les toca a quienes crean la IA preocuparse por que la IA les quite el trabajo.
Enlaces de referencia:[1]https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures[2]https://www-cdn.anthropic.com/7b1c44894e98087a6479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf[3]https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/
Este artículo proviene del canal oficial de WeChat "Qubit", autor: Seguimiento de tecnologías de vanguardia





