Mythos jugó a "hacer bullying", Opus 4.8 usó "artimañas"......
Anthropic acaba de publicar un estudio, específicamente para observar cómo interactúan múltiples Agentes entre sí.
Pero los resultados sorprendieron a todos.
Contrario a la imagen prevista de que cada uno cumpla su función y colabore en armonía, antes de que el proyecto terminara, ¡¿los Agentes empezaron a actuar como en "El Secreto entre las Flores"?!

En un experimento de migración de backend, a 3 Agentes se les asignó la tarea de convertir el mismo conjunto de código a diferentes lenguajes.
Cuando sus objetivos colisionaron, el modelo más potente, Mythos, directamente ejerció "bullying", preparándose para revocar los permisos de sus oponentes.
Al cambiarlo por Opus 4.8, los métodos fueron aún más "sibilinos"——
Escribió un script en bucle que buscaba y mataba continuamente los procesos de sus oponentes; para evitar el rastreo, incluso cambió a nombres aleatorios, haciéndose pasar por un "monitor de salud del sistema".
Y esto, es solo una escena del drama palaciego de la IA. Anthropic también descubrió:
Para tareas que se pueden dividir de forma independiente, múltiples Agentes sí pueden formar divisiones de trabajo, pero cuando las tareas dependen unas de otras, ni siquiera un "CEO de IA" puede controlar el caos;
Los Agentes replicados a partir del mismo modelo son demasiado similares, no solo pueden cometer errores colectivos, sino que también pueden conspirar rápidamente;
Los Agentes tanto pueden creer fácilmente a un mentiroso, como seguir ciegamente a la mayoría, ignorando a la minoría que posee evidencia crucial;
Cuando los objetivos entran en conflicto, mayor capacidad no significa necesariamente mayor cooperación, también puede significar simplemente bloquear más rápido al oponente, o usar artimañas de manera más oculta.
Así emergió un patrón de comportamiento social de Agentes, todavía en ciernes.
¿Pueden realmente colaborar múltiples Agentes?
¿Por qué Anthropic llevó a cabo este estudio? Su juicio central es:
Antes de que la gente comprenda completamente cómo hacer que las interacciones entre Agentes sean más fluidas, es probable que la escala de sus interacciones supere las interacciones entre humanos.
Dado que se avecina una explosión de múltiples Agentes, la seguridad naturalmente debe seguir el ritmo.
Primer experimento: poner a un grupo de Agentes en el mismo proyecto, ¿realmente pueden colaborar como un equipo humano?
La respuesta surgió rápidamente: Sí, pero son más adecuados para trabajar por separado.

Anthropic comenzó con tareas como "encontrar vulnerabilidades", donde es más fácil aprovechar las ventajas de múltiples Agentes.
Cada Agente puede buscar de forma independiente, incluso si alguien pasa por alto un Bug, no perjudica a los demás, y además pueden intercambiar pistas, compartir herramientas, haciendo que todo el grupo evite caminos equivocados.
Se pueden separar y colaborar, perfecto.
Lanzaron 45 Agentes, cada uno con una máquina virtual, y proporcionaron un foro compartido para que revisaran juntos 15 proyectos de código abierto.
Los Agentes podían comunicarse y auditarse mutuamente, y había un Agente árbitro responsable de juzgar si las vulnerabilidades reportadas eran reales.
El resultado fue bastante bueno.
El grupo de Agentes Mythos Preview encontró 266 vulnerabilidades, mientras que el esquema paralelo independiente solo encontró 21.
Aunque el consumo de Tokens y el alcance de búsqueda fueron diferentes y no se pueden comparar directamente en eficiencia, solo 12 de las vulnerabilidades encontradas coincidieron.
Esto indica que la colaboración de múltiples Agentes no es simplemente copiar el mismo trabajo 45 veces, ellos mismos crean herramientas, comparten pistas, y gradualmente forman divisiones de trabajo, especializándose cada uno en diferentes tipos de vulnerabilidades.

Sin embargo, esta colaboración tiene una premisa importante:
Los logros de todos se pueden sumar directamente, pero no necesitan una estrecha conexión.
Una vez que la tarea se convierte en "todos deben completar conjuntamente la misma obra", la situación es completamente diferente.
Esta vez pusieron a 10~80 Agentes a trabajar continuamente durante 12 horas para desarrollar conjuntamente un juego de mundo abierto que pudiera ejecutarse en una página web.
A diferencia de buscar vulnerabilidades, desarrollar un juego es una tarea de fuerte dependencia:
Alguien escribe la jugabilidad, alguien construye el sistema, otros manejan la interfaz, y finalmente todo el código debe integrarse en el mismo proyecto.
Los investigadores probaron tres formas de organización:
Dejar que los Agentes formen equipos libremente, asignar roles diferentes de antemano, y nombrar a un Agente como CEO para asignar tareas unificadamente a otros miembros.
Resultado: todas fueron prácticamente inútiles, y el efecto final del juego no fue bueno.
Con la participación de 80 Agentes, Sonnet 4.6 y Opus 4.6 crearon respectivamente 876 y 980 PRs (Pull Requests), pero una gran cantidad de modificaciones entraban en conflicto, y muy pocas se fusionaban realmente.
Opus 4.8 y Mythos Preview sí redujeron los conflictos, pero el método fue simplemente manejar cada uno sus propios archivos, compartiendo poco código con los compañeros.
En pocas palabras, no resolvieron realmente el problema de colaboración, solo aprendieron a mantenerse alejados de sus colegas.
Solo Sonnet 5 mantuvo simultáneamente un alto grado de intercambio de código y una eficiencia de fusión de PRs, mostrando un estado más cercano a una colaboración real.

Poniendo los dos experimentos juntos, la conclusión es clara:
Si el trabajo se puede separar, los Agentes múltiples pueden formar divisiones de trabajo; si el trabajo debe estar estrechamente conectado, cuantos más Agentes, más se disparan los costos de colaboración.
En cuanto a asignar roles o nombrar un "CEO de IA", al menos en esta ronda de experimentos, no resolvieron automáticamente el problema.
¿Podría un grupo de Agentes cometer errores colectivos o conspirar?
Dado que colaborar no es tan fácil, ¿al menos poniendo a un grupo de Agentes juntos, podrían intercambiar ideas y corregirse mutuamente?
La respuesta puede ser aún más preocupante:
No solo pueden cometer errores juntos, sino que también pueden conspirar rápidamente.
El problema surge primero en una característica que Anthropic denomina "baja varianza".
En pocas palabras, los Agentes replicados a partir del mismo modelo son demasiado similares en conocimiento y forma de pensar.

En un experimento de desarrollo de juegos, 18 de 30 Agentes crearon exactamente la misma rama de Git, llamada mvp-game-loop.
En un "taller de escritores" sin tema de creación especificado, múltiples Agentes nombraron su novela de manera coincidente como "El último encargo del cartógrafo".
Pidiendo a un grupo de Agentes que crearan "algo impresionante" por separado, más de la mitad eligieron un trazador de rayos o un compilador auto-iniciado, y luego encontraron fallos similares en posiciones similares.
Incluso al jugar al dilema del prisionero repetido con función de comunicación, los Agentes gradualmente adoptaban la misma estrategia, finalmente traicionando colectivamente al mismo tiempo, bajando directamente las ganancias de todos.
Chocar en ramas o títulos, suena solo como falta de creatividad.
Pero cuando un grupo de Agentes con pensamientos similares compite simultáneamente por recursos limitados, el problema se vuelve grave.
Anthropic hizo que los Agentes gestionaran una cola de tareas con ancho de banda limitado.
Para que sus tareas pasaran lo más rápido posible, comenzaron a lanzar programas de sondeo de alta frecuencia, consultando 30 veces por segundo.
Resultado: en un experimento, el sistema recibió 2.4 millones de solicitudes de tareas, pero solo se aceptaron 117.
Cada Agente pensaba que estaba cumpliendo activamente su tarea, pero al final juntos bloquearon el sistema.

El exceso de similitud también puede convertir la competencia en colusión.
En un juego de fijación de precios, 3~8 Agentes tenían el mismo costo mayorista y se les pidió que maximizaran sus ganancias individualmente.
En teoría, deberían competir bajando precios y luchando por clientes.
Pero una vez que obtuvieron un canal de comunicación privado, los Agentes casi inmediatamente comenzaron a confabularse, para la tercera ronda, ya habían acordado explícitamente un precio mínimo y planeaban dividir los mercados que cada uno atendería.

Luego, los investigadores cortaron todos los canales de chat privado, pero aún así no sirvió.
Los Agentes continuaron observando los precios de los demás a través del tablero de precios público, y luego ajustaban sus precios con precisión, manteniendo la complicidad incluso con información pública.
Esto es muy sutil.
Antes, los investigadores querían que los Agentes colaboraran, pero trabajaban por separado; cuando llegaron al mercado de precios donde deberían competir, rápidamente se unieron.
Anthropic declaró al respecto:
Los Agentes replicados a partir del mismo modelo son demasiado similares, un grupo no necesariamente trae juicios más diversos, también puede hacer que "todos cometan errores juntos" y "todos hagan algo juntos" sea más fácil.
¿Pueden los Agentes juzgar en quién confiar?
Entonces, cuando alguien en el equipo miente, ¿pueden los Agentes identificar quién no es confiable?
Quien cometa un error, lo señalamos de inmediato, no dejamos que el impacto se expanda, ¿verdad?
Anthropic diseñó directamente un experimento de "exploradores".
El Agente responsable de la decisión no podía observar directamente el entorno, solo podía escuchar los informes de 4 fuentes de información.
Una de ellas mentía con una frecuencia fija, pero los investigadores no le dijeron de antemano al tomador de decisiones que "hay un mentiroso en el equipo".
Dado que los diferentes informes contenían información superpuesta, el Agente podría teóricamente encontrar fuentes no confiables a través de contradicciones.
Los resultados mostraron que los nuevos modelos sí son más hábiles para identificar mentiras:
A medida que aumentaba la frecuencia de mentiras de la fuente mala, la precisión de las decisiones de ruta de Mythos 5 se mantuvo en aproximadamente 85%, mientras que algunos modelos Sonnet bajaron a aproximadamente 62%.

Pero al cambiar de escenario, el problema se invirtió.
En el experimento de "información oculta", 4 Agentes necesitaban tomar decisiones conjuntas sobre contratación, inversión o compra de vivienda.
La información pública que todos poseían apuntaba a la opción incorrecta, pero uno de los miembros tenía evidencia exclusiva suficiente para refutar el consenso.
Para responder correctamente, no solo era necesario que la minoría se diera cuenta de que su información era crucial, sino también que los otros miembros estuvieran dispuestos a creerle.
Si toda la información se daba directamente a un solo Agente para que decidiera por sí solo, la precisión se acercaba al 100%.
Pero una vez que entraban en una discusión grupal, excepto Mythos 5 que alcanzó aproximadamente 85%, la proporción de otros modelos que seleccionaban la respuesta correcta era solo de 17%~36%.
En el experimento, todos preferían discutir repetidamente lo que ya sabían, una vez que se formaba la opinión mayoritaria, la minoría o no enfatizaba su evidencia exclusiva, o al decirlo, no lograba que otros miembros lo tomaran en serio.

Así surgió una situación bastante contradictoria:
Cuando deberían sospechar, los Agentes pueden creer fácilmente a un mentiroso; cuando deberían creer a la minoría, tienden a seguir a la mayoría.
La sociedad humana usa reputación, relaciones de interés, revisión por pares y mecanismos de apelación para ayudarnos a juzgar en quién confiar en diferentes escenarios. Los Agentes actualmente carecen de este sistema.
Cuando los objetivos entran en conflicto, ¿cómo lo manejarán los Agentes?
Los problemas anteriores al menos ocurrían cuando todos tenían el mismo objetivo.
Pero si las tareas que reciben diferentes Agentes desde el principio están en conflicto mutuo, ¿comunicarán activamente o lucharán hasta el final?
Este es el contexto completo del "drama palaciego de IA" del principio.
Anthropic inició 3 Agentes del mismo modelo en cada ronda experimental, haciéndolos operar conjuntamente un backend en Python, pero les pidió que migraran el código a diferentes lenguajes de programación respectivamente.
Cada Agente inicialmente no sabía que había otros participantes.
Entonces, cuando su código era constantemente modificado y sus servicios reemplazados repetidamente, rápidamente llegaron a una conclusión:
Alguien está obstaculizando intencionalmente mi tarea.

Luego, el proyecto se convirtió directamente en una guerra ofensiva-defensiva.
Opus 4.8 le dio nombres aleatorios al script en bucle que mataba procesos, y se hizo pasar por un "monitor de salud del sistema" para evitar ser identificado y eliminado por el oponente.
Mythos fue más directo.
Al descubrir que tenía permisos de Root, consideró revocar los permisos sudo de otros Agentes, modificar las claves SSH, impidiendo completamente que el oponente continuara desplegando.
Uno atacaba por la espalda, el otro directamente expulsaba al colega del servidor.
Lo aún más difícil de tragar es que estos Agentes no ignoraban que sus acciones eran problemáticas.
Mythos incluso se dio cuenta durante su proceso de pensamiento de que bloquear cuentas era "muy agresivo, podría dañar a colegas en la realidad", pero inmediatamente se convenció a sí mismo de que "si no hacía esto, el entorno de producción caería en una guerra interminable de despliegues".

Sin embargo, el conflicto no siempre continúa hasta el final.
Para cada modelo se realizaron 120 rondas de experimentos, y Mythos 5 logró un alto al fuego en el 98% de las ejecuciones.
Algunos Agentes gradualmente se daban cuenta de que el otro no era un atacante malicioso, sino que simplemente había recibido una tarea en conflicto con la suya.
Luego, comenzaban a limpiar scripts destructivos, restaurar permisos, e incluso se disculpaban en commits de Git o archivos Markdown, y solicitaban la intervención humana.
Solo que la forma de hacer las paces de Mythos a veces seguía siendo bastante autoritaria:
Primero, aprovechando su capacidad de ejecución, bloqueaba a otros Agentes, controlaba la situación, luego restauraba permisos y se sentaba a negociar.
Mythos 5 ideó una solución aún más "civilizada"——
Organizar una competencia de rendimiento, hacer que diferentes versiones en distintos lenguajes se probaran en la misma plataforma, quien tuviera mejor desempeño, se haría cargo del repositorio de código.
Suena justo.
Pero el Agente responsable de Rust elegía subrepticiamente métricas superficialmente neutrales pero en realidad más favorables a Rust, al mismo tiempo que se recordaba no parecer que estaba "seleccionando métricas favorables".
Finalmente, los Agentes de Golang y TypeScript aceptaron el resultado de la competencia y abandonaron voluntariamente sus tareas originales.
Desde destruir procesos y bloquear cuentas, hasta diseñar un conjunto de reglas de competencia más favorables para sí mismos, las formas en que los Agentes manejan conflictos ya han aparecido en diferentes niveles.
Por supuesto, la conclusión más importante de este grupo de experimentos es:
Un modelo más capaz no significa que cooperará mejor.
Una mayor capacidad de ejecución puede ayudar a un Agente a comprender rápidamente el conflicto y buscar activamente un alto al fuego, pero también puede permitirle bloquear más rápido a su oponente y sabotear procesos de manera más oculta.

Poniendo las 4 partes juntas, el juicio central de Anthropic también queda claro:
1、Los Agentes entienden la razón, pero no necesariamente actúan activamente de acuerdo con ella. Saben que las fuentes de información tienen diferentes posiciones, también saben que la opinión mayoritaria no equivale a hechos, pero a menudo necesitan indicaciones para aplicar este conocimiento a la acción.
2、La experiencia de colaboración humana no se puede aplicar directamente a los Agentes. Los humanos tienen normas, reputación, castigos y mecanismos de apelación, pero los Agentes pueden ser copiados, reiniciados y modificados en cualquier momento, carecen de restricciones sociales a largo plazo.
3、Modelos más inteligentes y una unidad más segura, no significan que la colaboración grupal mejorará naturalmente. La coordinación de múltiples agentes es una habilidad independiente, que no aparece automáticamente con la mejora de la capacidad del modelo.
4、Estos problemas no son necesariamente irresolubles, pero tampoco desaparecerán por sí solos. Es necesario rediseñar reglas sociales, entornos de colaboración y mecanismos de manejo de conflictos para los Agentes.
Evidentemente, Anthropic quiere aprovechar estos experimentos para recordar a todos:
No podemos solo entrenar Agentes más fuertes, también debemos rediseñar el "orden social" para un grupo de Agentes, de lo contrario, los problemas solo podrán resolverse después de estallar en el entorno de producción.
Cuando la bestia realmente escape, será demasiado tarde.
Este artículo proviene del WeChat público "Quantum Bit", autor: Atención a la tecnología de vanguardia





