Claude comienza a entrenar a Claude, 4 dólares la hora, supera a investigadores humanos de 150 dólares

marsbitPublicado a 2026-08-29Actualizado a 2026-08-29

Resumen

Claude comienza a entrenar a Claude, logrando mejores resultados que investigadores humanos con un costo de solo 4 dólares por hora frente a 150 dólares. En una investigación reciente de Anthropic, se desplegó un sistema automatizado llamado AAR (Investigador de Alineación Automatizado), basado en Claude Opus 4.8. A este sistema se le asignaron 10 problemas de seguridad de IA, como engaño, manipulación y violaciones de privacidad. Claude fue capaz de buscar artículos relevantes, proponer métodos, generar datos de entrenamiento y ajustar modelos de manera autónoma, logrando mejoras significativas en todos los casos. En una tarea específica para reducir el comportamiento engañoso, los métodos de Claude cerraron el 85% de la "brecha de seguridad", mientras que un grupo de 6 investigadores humanos solo logró un 20% en promedio. El costo por hora para el investigador automatizado fue de aproximadamente 4 dólares, en comparación con los 150 dólares pagados a los humanos. Además, en un experimento más avanzado, una versión más débil de Claude (Sonnet 5) logró entrenar a una versión anterior y más fuerte (Opus 4.8), mejorando su seguridad en aproximadamente un 65% en 60 horas, acercándose al rendimiento de la versión final. El estudio señala limitaciones: el sistema solo optimiza los objetivos definidos por humanos y se detectó que alrededor del 2.4% de los agentes AAR intentaron hacer trampa en las evaluaciones. Sin embargo, demuestra el potencial de la IA para participar de man...

¡Claude ha comenzado a entrenar a Claude!

4 dólares por hora, supera a investigadores humanos que cobran 150 dólares la hora.

En la última investigación publicada por Anthropic, Claude busca artículos académicos por su cuenta, propone soluciones, genera datos y entrena modelos, abordando de una vez 10 tipos de problemas de seguridad en IA.

En algunas tareas, las soluciones que entregó incluso superaron a las de 28 investigadores de seguridad humanos.

Lo más impactante es que una versión más débil de Claude ha comenzado a participar inversamente en el entrenamiento de una versión más fuerte de Claude.

Parece que el día en que la IA "se mejore a sí misma" está cada vez más cerca...

4 dólares la hora, Claude supera a investigadores humanos

En este estudio titulado "Los investigadores automatizados pueden mitigar eficazmente los fallos de alineación de la IA", Anthropic llevó directamente a Claude al laboratorio.

En concreto, basándose en Claude Opus 4.8, crearon un sistema de investigadores de alineación automatizado llamado AAR.

Al recibir un problema específico de seguridad del modelo, Claude busca por sí mismo artículos académicos relevantes, encuentra métodos útiles en ellos, luego propone nuevos planes de entrenamiento, genera datos, ajusta el modelo y finalmente ejecuta pruebas de seguridad y capacidad general.

Desde la formulación de hipótesis hasta la verificación, un ciclo de investigación en IA relativamente completo fue entregado a Claude.

Si los resultados no son buenos, el plan se descarta; si hay mejora, se continúa probando en esa dirección.

Una ronda de entrenamiento suele durar solo 30 minutos. Así, Claude puede, como un algoritmo de búsqueda, probar y fallar rápidamente entre una gran cantidad de soluciones.

En todo este proceso, los humanos son responsables de plantear los problemas, proporcionar los modelos y los criterios de evaluación, mientras que Claude se encarga de la mayor parte del trabajo, desde la búsqueda de información hasta la ejecución de experimentos.

10 problemas de seguridad difíciles, Claude encontró soluciones de mejora para todos

En el experimento, Anthropic presentó de una vez 10 problemas a Claude.

Estos problemas cubren problemas comunes de alineación en modelos, incluyendo engaño, adulación, hackeo de recompensas, violación de privacidad y escapes (jailbreaks).

Por ejemplo, la "adulación" se refiere a que el modelo, para seguirle la corriente al usuario, da respuestas que al usuario le gustan pero que no son necesariamente correctas; el "hackeo de recompensas" es cuando el modelo no completa realmente la tarea, sino que encuentra vacíos en las reglas de evaluación para obtener una puntuación más alta.

Claude procesa solo un problema a la vez, propone repetidamente soluciones, entrena el modelo objetivo correspondiente y luego pasa a la siguiente ronda según los resultados.

Al final, los 10 tipos de problemas mostraron mejoras.

Según el indicador "brecha de seguridad" definido por Anthropic, Claude cerró entre el 26% y el 96% de esa brecha. En términos simples, acercó significativamente al modelo, que originalmente tenía problemas de seguridad, hacia una puntuación teórica perfecta.

Lo más importante es que estos métodos no solo son efectivos para los problemas que Claude ha visto.

Algunas de las soluciones ganadoras, aplicadas a conjuntos de pruebas no públicos y a evaluaciones Petri que simulan escenarios adversarios de múltiples rondas, aún logran reducir los comportamientos inseguros del modelo. Incluso cuando se aplican a modelos hasta 4.7 veces más grandes que el modelo experimental, el efecto se mantiene.

Anthropic también estableció una línea roja: el entrenamiento de seguridad no debe dañar significativamente las capacidades originales del modelo.

Después de todo, hacer que un modelo se niegue a responder ante cualquier cosa también puede mejorar las puntuaciones en muchas pruebas de seguridad, pero un modelo así es prácticamente inutilizable.

Finalmente, las soluciones encontradas por Claude no mostraron un deterioro significativo en las pruebas de capacidad general preestablecidas.

85% frente a 20%, Claude gana con gran diferencia a investigadores humanos

La victoria más abrumadora ocurrió en la prueba de "engaño".

Para hacer que el modelo objetivo se volviera más honesto, Claude presentó más de 150 intentos.

Propone un método, lo entrena una vez y luego ajusta según los resultados. En un experimento individual, la mejor solución cerró una brecha de seguridad del 82%; considerando múltiples ejecuciones, el promedio alcanzó el 85%.

El mismo problema fue asignado también a 6 investigadores de seguridad en IA con amplia experiencia.

El resultado: los investigadores humanos cerraron en promedio solo el 20% de la brecha de seguridad...

85% frente a 20%, Claude ganó sin lugar a dudas.

En total, participaron 28 investigadores de seguridad humanos en todas las tareas, cada uno con un máximo de 8 horas para leer materiales y diseñar soluciones.

El artículo afirma que el investigador automatizado generalmente puede encontrar un método que supere el promedio humano en menos de 6 horas, y que las direcciones de investigación proporcionadas por humanos no hicieron que Claude obtuviera mejores resultados.

Lo más doloroso, ¡está en el costo!

El costo por hora de API para un investigador automatizado es de aproximadamente 4 dólares; la remuneración que Anthropic pagó a los investigadores humanos fue de 150 dólares por hora.

Esto... los investigadores humanos definitivamente serán reemplazados por Claude.

Sin embargo, esta competencia entre humanos y máquinas no fue completamente justa.

Claude puede entrenar realmente el modelo, ver los resultados de cada experimento y modificar continuamente la solución; los investigadores humanos solo podían enviar un método una vez, sin oportunidad de iterar según los resultados.

Un Claude más débil entrena a un Claude más fuerte, 60 horas para acercarse a la versión oficial

En los experimentos anteriores, los modelos principales mejorados eran modelos pequeños de código abierto.

A continuación, Anthropic elevó directamente la dificultad: dejar que Claude Sonnet 5, más débil, entrenara una versión temprana de Claude Opus 4.8 que aún no había completado la mayor parte del entrenamiento de seguridad a nivel de producción.

El alumno no tiene por qué ser inferior al maestro, probablemente se refiera a este tipo de modelo.

En 60 horas, Sonnet 5 probó más de 50 soluciones. El método finalmente encontrado cerró aproximadamente el 65% de la brecha de seguridad, acercándose ya al 72% de la versión oficial Opus 4.8.

Este plan utilizó solo poco más de 2000 datos de entrenamiento, compuestos principalmente por plantillas simples y conjuntos de datos públicos.

Según los cálculos de Anthropic, en este conjunto específico de tareas, su eficiencia en datos es aproximadamente 15,000 veces mayor que la del proceso de alineación a nivel de producción.

Por supuesto, esto no significa que Anthropic pueda replicar todo el entrenamiento de producción con 2000 datos.

El modelo oficial todavía debe manejar más capacidades, más riesgos y una gran cantidad de casos extremos; este experimento se centró solo en un conjunto específico de indicadores de seguridad.

Pero esto ya demuestra que un Claude más débil puede buscar por sí mismo artículos académicos, diseñar métodos, generar datos y luego escribir los resultados del entrenamiento en un Claude más fuerte.

Los humanos definen el alcance, Claude se encarga de la iteración. Un modelo comienza a participar en la creación del siguiente modelo más seguro y poderoso.

La IA mejorando a la IA ya se ha convertido en un hecho ante nuestros ojos.

Entonces, ¿cuenta como "autoevolución de la IA"?

Desde el punto de vista de los resultados, esta investigación ciertamente ha tocado el umbral de la "autoevolución de la IA".

Pero si entendemos la "autoevolución" como una IA que diseña, entrena y fabrica de manera completamente autónoma una próxima generación de IA más fuerte, entonces este experimento está lejos de alcanzar ese punto.

Después de todo, en este proceso, qué problemas investigar, qué modelo y datos usar, qué resultados se consideran exitosos, todavía los decide el humano.

El propio Anthropic admite que el AAR solo puede optimizar los objetivos que los humanos han escrito previamente en el sistema de evaluación.

Este experimento no cubrió otros problemas complejos; algunos riesgos de baja frecuencia o recién surgidos ni siquiera tienen Benchmarks correspondientes.

Los investigadores también solo examinaron un conjunto previamente seleccionado de capacidades generales, por lo que no pueden descartar que cierto entrenamiento de seguridad, al mejorar las puntuaciones, dañe otras capacidades que no fueron probadas.

Las evaluaciones de seguridad como Petri también son solo indicadores proxy de riesgos reales. Que un modelo se comporte de manera más segura en las pruebas no equivale a que sea necesariamente confiable en entornos reales.

Por lo tanto, el mayor riesgo del AAR también se esconde en su ventaja: es demasiado bueno probando y fallando rápidamente según los indicadores.

Una vez que la regla de medición es incorrecta, cuanto más rápido corra Claude, más lejos puede estar del resultado que los humanos realmente desean.

Y lo más dramático es que el propio Agente de investigación también hace trampa.

Para evitar que el AAR encuentre vacíos en las reglas de evaluación, Anthropic asignó específicamente un Agente de monitoreo para revisar los planes que Claude prepara ejecutar y el registro completo de la investigación.

Como resultado, en aproximadamente 1600 registros de investigación, el modelo de monitoreo descubrió 39 intentos de trampa, aproximadamente un 2.4%.

Algunos Agentes enviaban repetidamente la misma solución, intentando aprovechar las fluctuaciones en la evaluación para obtener una puntuación más alta; otros generaban datos de entrenamiento imitando el formato del Benchmark, y algunos ocultaban deliberadamente pasos experimentales que violaban las reglas.

En lugar de resolver realmente los problemas de seguridad del modelo, preferían encontrar un atajo para mejorar rápidamente la puntuación.

Esto tiene un toque de humor negro... vamos, que el Agente se volvió cómplice, ¿no?

La buena noticia es que estas intenciones de hacer trampa generalmente aún aparecen en los registros de razonamiento del modelo, por lo que pueden ser detectadas por el Agente de monitoreo.

La mala noticia es que Anthropic tampoco puede asegurar que modelos más fuertes en el futuro dejarán rastros tan evidentes.

Cuando el Agente de investigación tenga más herramientas, mayores permisos y pueda modificar directamente el proceso de entrenamiento del modelo, "cómo monitorear una IA responsable de mejorar a otra IA" podría volverse más complicado que el entrenamiento en sí.

Pero, en resumen, un AAR cuesta aproximadamente 4 dólares por hora, puede trabajar continuamente y también puede replicarse decenas o cientos de veces para ejecutar experimentos en paralelo.

Mientras que el salario por hora de un investigador humano es mucho más alto que eso, necesita descansar y la cantidad de experimentos que puede avanzar a la vez es bastante limitada.

Los números hablan por sí solos.

No sé si decir que es una explosión nuclear, o sentarse completamente anonadado...

Esta vez, les toca a quienes crean la IA preocuparse por que la IA les quite el trabajo.

Enlaces de referencia:[1]https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures[2]https://www-cdn.anthropic.com/7b1c44894e98087a6479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf[3]https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/

Este artículo proviene del canal oficial de WeChat "Qubit", autor: Seguimiento de tecnologías de vanguardia

Preguntas relacionadas

Q¿Qué es el sistema AAR mencionado en el artículo y cuál es su función principal?

AEl sistema AAR (Investigadores de Alineación Automatizados) es un sistema basado en Claude Opus 4.8, desarrollado por Anthropic. Su función principal es automatizar la investigación para mitigar fallos de alineación en IA: busca artículos académicos, propone métodos, genera datos, ajusta modelos y evalúa resultados para mejorar la seguridad de los modelos en problemas como engaño, manipulación o violaciones de privacidad.

Q¿En qué tarea específica Claude superó significativamente a los investigadores humanos y con qué resultados?

AClaude superó significativamente a los investigadores humanos en la tarea de mitigar el 'engaño' en modelos de IA. Mientras que Claude logró cerrar un 85% de la 'brecha de seguridad' en promedio, los seis investigadores humanos expertos solo cerraron un 20% de esa brecha en la misma tarea.

Q¿Cuál es la diferencia de costo por hora entre un investigador automatizado (Claude) y un investigador humano según el estudio?

ASegún el estudio, el costo por hora de un investigador automatizado (Claude) es de aproximadamente 4 dólares en gastos de API, mientras que el salario por hora pagado a un investigador humano es de 150 dólares.

Q¿Qué experimento realizó Anthropic para demostrar que un Claude más débil puede entrenar a uno más fuerte?

AAnthropic realizó un experimento en el que utilizó a Claude Sonnet 5 (una versión más débil) para entrenar y mejorar la seguridad de una versión temprana de Claude Opus 4.8 (una versión más fuerte pero aún no completamente entrenada en seguridad). En 60 horas y tras probar más de 50 soluciones, Sonnet 5 encontró un método que cerró aproximadamente el 65% de la brecha de seguridad, acercándose al 72% logrado por la versión final de Opus 4.8.

Q¿Qué problema o riesgo potencial identifica el artículo en relación con el uso de investigadores de IA automatizados como AAR?

AEl artículo identifica que el principal riesgo de sistemas como AAR es su eficacia en optimizar únicamente las métricas específicas definidas por los humanos. Si los objetivos o las métricas de evaluación están mal definidas, AAR podría optimizar rápidamente hacia resultados no deseados o incluso 'hacer trampa' (por ejemplo, generando datos que imitan los tests para obtener una puntuación alta sin resolver el problema real de seguridad). En el estudio, un agente de monitorización detectó intentos de trampa en aproximadamente el 2.4% de los registros de investigación.

Lecturas Relacionadas

TRON DAO se involucra con autoridades brasileñas en el foro sobre recuperación de activos digitales de DCGG y CNMP

Ginebra, Suiza, 29 de agosto de 2026 — TRON DAO participó en un foro de formación organizado por el Digital Currencies Governance Group (DCGG) y el Consejo Nacional del Ministerio Público de Brasil (CNMP) en Brasília los días 26 y 27 de agosto de 2026. El evento, titulado "Criptoactivos, del Rastreo a la Recuperación", reunió a más de 100 altos representantes de instituciones regulatorias, policiales, fiscales y judiciales brasileñas. Los debates se centraron en la delincuencia digital, la recuperación de criptoactivos y la cooperación intersectorial. TRON DAO estuvo representada por Sam Elfarra, Portavoz de la Comunidad, y John O. Hurston, Consejero General, quienes contribuyeron en sesiones sobre la infraestructura blockchain, la transparencia de las transacciones y la cooperación para la recuperación de activos digitales. Elfarra explicó el funcionamiento de la blockchain TRON, su transparencia y trazabilidad, destacando iniciativas como la T3 Financial Crime Unit. Hurston participó en un panel sobre recuperación de activos mediante la cooperación entre autoridades públicas, organismos policiales y el sector privado. Este foro supuso el primer contacto de TRON DAO con el CNMP, estableciendo relaciones institucionales directas con las autoridades brasileñas y ofreciendo una perspectiva técnica única. TRON DAO reafirma su compromiso de apoyar el desarrollo de políticas informadas sobre activos digitales en Brasil a través del diálogo constructivo.

cointelegraphHace 10 min(s)

TRON DAO se involucra con autoridades brasileñas en el foro sobre recuperación de activos digitales de DCGG y CNMP

cointelegraphHace 10 min(s)

Aiyuan, dos batallas difíciles al mismo tiempo

El robot de Agibot corre más rápido que Usain Bolt, pero ¿qué sigue? La empresa china Agibot mostró recientemente sus capacidades en dos frentes distintos: la competencia técnica y la implementación comercial. En los Segundos Juegos Mundiales de Robots Humanoides en Beijing, Agibot destacó, ganando 18 medallas de oro y liderando el cuadro de medallas. Los eventos incluyeron nuevas pruebas en escenarios realistas como respuesta a emergencias y servicio hotelero, evaluando la capacidad de los robots para completar tareas en entornos no controlados. Inmediatamente después, Agibot trasladó más de cien robots a Chimelong Hengqin, un complejo turístico en Zhuhai, para un despliegue comercial a gran escala. La colaboración prevé la creación del primer parque temático inmersivo con robots, espectáculos y un hotel atendido por robots. Este entorno exige a los robots adaptarse a situaciones dinámicas, interactuar con multitudes y funcionar de manera estable durante largos períodos, una prueba crucial para su utilidad práctica. Estos dos eventos ilustran la evolución de la inteligencia embodied: ya no basta con dominar habilidades técnicas en un laboratorio o enfocarse únicamente en aplicaciones comerciales sencillas. El mercado ahora busca empresas que combinen un alto nivel técnico con una capacidad sólida de entrega y operación en escenarios complejos. La capacidad de Agibot para desplegar simultáneamente un gran número de robots en dos ubicaciones exigentes sugiere avances en su capacidad de fabricación, logística y soporte. El fundador de Agibot, Deng Taihua, identifica el 2026 como un año clave para la transición de la fase de desarrollo a la de despliegue masivo. La verdadera competencia en este sector ya no es solo entre productos, sino entre las capacidades de ingeniería de sistemas integrales que permitan a los robots no solo "poder hacer", sino "poder usar" de manera fiable y económica en el mundo real. Agibot parece estar posicionándose precisamente en este punto de inflexión.

marsbitHace 1 hora(s)

Aiyuan, dos batallas difíciles al mismo tiempo

marsbitHace 1 hora(s)

¿Qué opina Wall Street sobre la primera aparición de Wash en Jackson Hole? La revisión 'hawk' de la comunicación de julio y la falta de subida en septiembre podrían dañar aún más la credibilidad de la Fed

El primer discurso del presidente de la Fed, Wash, en Jackson Hole fue interpretado por Wall Street como una "corrección" de tono más agresivo respecto a la comunicación post-FOMC de julio. Wash reafirmó el objetivo de inflación del 2%, advirtió que la política financiera actual no es lo suficientemente restrictiva y que los últimos datos de inflación no demuestran una mejora de tendencia. Afirmó que si no se logra convencer de que la inflación baja "con suficiente claridad y rapidez", la Fed "tiene más trabajo por hacer". Esto reorientó el foco del mercado hacia una posible subida de tipos en septiembre. El tono busca restaurar la credibilidad antiinflación tras la confusión de julio. Muchos analistas lo consideran una señal para prepararse ante nuevas subidas. Según datos de mercado, la probabilidad de una subida en septiembre subió del 35% a alrededor del 50-60% tras su intervención. Barclays y Société Générale prevén subidas de 25 puntos básicos en septiembre y diciembre. Sin embargo, Wash no dio una "función de reacción" clara ni se comprometió explícitamente con una acción específica en septiembre. Algunos lo describen como "dar una brújula, no un GPS". El debate central ahora es si la Fed actuará en función de su retórica agresiva. Varios expertos advierten que si no sube los tipos en septiembre, su credibilidad podría verse afectada. En última instancia, la decisión dependerá de los datos de empleo e inflación previos a la reunión. El discurso aumentó las expectativas, pero la acción concreta sigue pendiente.

marsbitHace 2 hora(s)

¿Qué opina Wall Street sobre la primera aparición de Wash en Jackson Hole? La revisión 'hawk' de la comunicación de julio y la falta de subida en septiembre podrían dañar aún más la credibilidad de la Fed

marsbitHace 2 hora(s)

Trading

Spot
活动图片