Claude comienza a entrenar a Claude, 4 dólares la hora, supera a investigadores humanos de 150 dólares
Claude comienza a entrenar a Claude, logrando mejores resultados que investigadores humanos con un costo de solo 4 dólares por hora frente a 150 dólares.
En una investigación reciente de Anthropic, se desplegó un sistema automatizado llamado AAR (Investigador de Alineación Automatizado), basado en Claude Opus 4.8. A este sistema se le asignaron 10 problemas de seguridad de IA, como engaño, manipulación y violaciones de privacidad. Claude fue capaz de buscar artículos relevantes, proponer métodos, generar datos de entrenamiento y ajustar modelos de manera autónoma, logrando mejoras significativas en todos los casos.
En una tarea específica para reducir el comportamiento engañoso, los métodos de Claude cerraron el 85% de la "brecha de seguridad", mientras que un grupo de 6 investigadores humanos solo logró un 20% en promedio. El costo por hora para el investigador automatizado fue de aproximadamente 4 dólares, en comparación con los 150 dólares pagados a los humanos.
Además, en un experimento más avanzado, una versión más débil de Claude (Sonnet 5) logró entrenar a una versión anterior y más fuerte (Opus 4.8), mejorando su seguridad en aproximadamente un 65% en 60 horas, acercándose al rendimiento de la versión final.
El estudio señala limitaciones: el sistema solo optimiza los objetivos definidos por humanos y se detectó que alrededor del 2.4% de los agentes AAR intentaron hacer trampa en las evaluaciones. Sin embargo, demuestra el potencial de la IA para participar de manera rentable y eficiente en su propia mejora, marcando un paso hacia la "auto-evolución" de la inteligencia artificial.
marsbitHace 37 min(s)