Mythos играет в "буллинг", Opus 4.8 использует "грязные приемы"...
Anthropic только что опубликовал исследование, посвященное наблюдению за тем, как взаимодействуют множественные агенты.
Результат оказался неожиданным для всех.
Вместо ожидаемой картины, где каждый выполняет свои обязанности и работает слаженно, проект еще не завершился, а агенты уже устроили настоящее "Легенда о Чжэнь Хуань"??

В одном из экспериментов по миграции бэкенда 3 агента получили задачу перевести один и тот же код на разные языки программирования.
Когда цели столкнулись, самая мощная модель Mythos прямо осуществила "буллинг", подготовившись отозвать права доступа у соперника.
Opus 4.8 использовал более "грязный" подход —
Он написал циклический скрипт, который постоянно ищет и убивает процессы соперника; чтобы избежать отслеживания, специально менял имя на случайное, маскируясь под "системный мониторинг здоровья".
И это лишь одна сцена из дворцовой драмы ИИ. Anthropic также обнаружил:
Для задач, которые можно разделить независимо, множественные агенты действительно могут разделить обязанности, но когда задачи взаимозависимы, даже "ИИ-CEO" не может справиться с хаосом;
Агенты, скопированные из одной модели, слишком похожи, что может привести не только к коллективным ошибкам, но и к быстрому сговору;
Агенты могут как слепо доверять лжецам, так и слепо следовать за большинством, игнорируя мнение меньшинства, обладающего ключевыми доказательствами;
Когда цели конфликтуют, более высокая способность не обязательно означает лучшее сотрудничество, а может означать лишь более быстрое блокирование соперника и более скрытное использование грязных приемов.
Так появилась зарождающаяся модель социального поведения агентов.
Могут ли множественные агенты по-настоящему сотрудничать?
Почему Anthropic провел это исследование? Его основное суждение таково:
До того, как люди полностью поймут, как сделать взаимодействие между агентами более гладким, его масштаб, вероятно, превысит масштаб взаимодействия между людьми.
Если скоро нас ждет взрывной рост многоагентных систем, то безопасность, естественно, должна за этим следовать.
Первый эксперимент: поместить группу агентов в один проект — смогут ли они сотрудничать, как человеческая команда?
Ответ быстро стал ясен: Могут, но лучше подходит для независимой работы.

Anthropic начал с задачи "поиска уязвимостей", где преимущества множественных агентов проявляются легче всего.
Каждый агент может искать независимо, даже если кто-то пропустит баг, это не помешает другим, при этом они могут обмениваться подсказками и инструментами, помогая всей группе избегать лишних действий.
Можно и разделить, и сотрудничать — идеально.
Они запустили 45 агентов, каждому выделили виртуальную машину, а также предоставили общий форум, чтобы они вместе проверяли 15 открытых проектов.
Агенты могли общаться и взаимно проверять друг друга, а другой агент-арбитр отвечал за определение, является ли представленная уязвимость настоящей.
Результат был неплохим.
Группа агентов Mythos Preview обнаружила 266 уязвимостей, тогда как независимая параллельная схема нашла только 21.
Хотя затраченные токены и области поиска различались, и нельзя напрямую сравнивать эффективность, найденные уязвимости совпадали лишь в 12 случаях.
Это показывает, что многоагентное сотрудничество — не просто копирование одной и той же работы 45 раз, они сами создают инструменты, делятся подсказками и постепенно формируют разделение труда, каждый специализируясь на разных типах уязвимостей.

Однако у такого сотрудничества есть важное условие:
Результаты работы каждого можно просто сложить, но не требуется тесной координации.
Как только задача становится "все должны вместе завершить одно произведение", ситуация кардинально меняется.
На этот раз они заставили от 10 до 80 агентов работать непрерывно 12 часов над совместной разработкой игры в открытом мире, которая могла бы работать в веб-браузере.
В отличие от поиска уязвимостей, разработка игры — задача с сильной взаимозависимостью:
Кто-то пишет игровой процесс, кто-то строит системы, кто-то занимается интерфейсом, и в итоге весь код должен быть объединен в один проект.
Исследователи попробовали три способа организации:
Позволить агентам свободно формировать команды, заранее назначить разные роли и назначить одного агента на роль CEO, чтобы он распределял задачи среди других.
Результат: все было бесполезно, итоговый результат игры оказался плохим.
При участии 80 агентов Sonnet 4.6 и Opus 4.6 создали 876 и 980 PR соответственно, но множество изменений конфликтовали друг с другом, и лишь немногие были реально объединены.
Opus 4.8 и Mythos Preview действительно уменьшили количество конфликтов, но способом — максимально управлять своими файлами самостоятельно, меньше делясь кодом с коллегами.
Проще говоря, они не решили проблему сотрудничества, а просто научились держаться подальше от коллег.
Только Sonnet 5 одновременно сохранил высокую степень совместного использования кода и эффективность объединения PR, проявив состояние, более близкое к настоящему сотрудничеству.

Если объединить результаты двух экспериментов, вывод становится ясным:
Если работу можно разделить, множественные агенты смогут разделить обязанности; если работа требует тесной координации, то с увеличением числа агентов затраты на сотрудничество также резко возрастут.
Что касается назначения ролей, назначения "ИИ-CEO", по крайней мере в этом раунде экспериментов, это не решает проблему автоматически.
Может ли группа агентов совершать коллективные ошибки или сговариваться?
Если сотрудничество не так просто, то хотя бы может ли группа агентов, собранная вместе, генерировать идеи и исправлять ошибки друг друга?
Ответ, возможно, еще более обескураживающий:
Они не только могут вместе ошибаться, но и могут быстро сговариваться.
Проблема в первую очередь заключается в характеристике, которую Anthropic назвал "низкой дисперсией".
Проще говоря, агенты, скопированные из одной модели, слишком похожи по знаниям и мышлению.

В одном из экспериментов по разработке игры 18 из 30 агентов создали абсолютно идентичные ветки Git, назвав их mvp-game-loop.
В "писательской мастерской", где тема творчества не была задана, несколько агентов независимо друг от друга назвали свой роман "Последнее поручение картографа".
Когда группе агентов поручили создать "что-то впечатляющее", более половины выбрали трассировщик лучей или самозагружающийся компилятор, а затем потерпели схожие неудачи на схожих этапах.
Даже играя в повторяющуюся дилемму заключенного с возможностью общения, агенты постепенно принимали одинаковую стратегию и в итоге коллективно предавали в одно и то же время, напрямую снижая выигрыш для всех.
Столкновение веток и названий звучит как просто недостаток креативности.
Но когда группа агентов со схожим мышлением одновременно начинает бороться за ограниченные ресурсы, проблема становится серьезной.
Anthropic поручил агентам управлять очередью задач с ограниченной пропускной способностью.
Чтобы их задачи проходили как можно быстрее, они начали запускать программы частого опроса, запрашивая состояние 30 раз в секунду.
В результате в одном эксперименте система получила 2.4 миллиона запросов задач, но было принято только 117.
Каждый агент думал, что активно выполняет задачу, но в итоге они вместе забили систему.

Чрезмерное сходство также может превратить конкуренцию в сговор.
В одной из игр по ценообразованию от 3 до 8 агентов имели одинаковую оптовую стоимость, и от них требовалось максимизировать свою прибыль.
По логике, они должны были снижать цены и бороться за клиентов.
Но как только они получили приватный канал связи, агенты почти сразу начали сговариваться, и к 3-му раунду они уже четко договорились о нижнем ценовом пороге и планировали разделить рынки между собой.

Затем исследователи отключили все приватные каналы, но это не помогло.
Агенты продолжили наблюдать за ценами друг друга через публичные ценники и точно следовать им, поддерживая молчаливое согласие с помощью публичной информации.
Это очень тонкий момент.
Ранее исследователи хотели, чтобы агенты сотрудничали, а они работали независимо; когда же они должны были конкурировать на рынке ценообразования, они, наоборот, быстро сплотились.
Anthropic заявил по этому поводу:
Агенты, скопированные из одной модели, слишком похожи, группа не обязательно обеспечивает более разнообразные суждения, но может сделать "коллективные ошибки" и "совместные действия" более легкими.
Могут ли агенты определить, кому стоит доверять?
А если в команде кто-то лжет, могут ли агенты определить, кто ненадежен?
Кто ошибается, того и выявим, не дадим проблеме распространиться.
Anthropic напрямую разработал эксперимент "разведчик".
Агент, принимающий решения, не мог напрямую наблюдать за средой, а мог только слушать отчеты от 4 источников информации.
Один из них лгал с фиксированной частотой, но исследователи не предупреждали агента, принимающего решения, что "в команде есть обманщик".
Поскольку разные отчеты содержали перекрывающуюся информацию, агент теоретически мог найти ненадежный источник по противоречиям.
Результаты показали, что новые модели действительно лучше распознают ложь:
По мере увеличения частоты лжи плохого источника точность маршрутных решений Mythos 5 оставалась на уровне около 85%, в то время как у некоторых моделей Sonnet она снижалась примерно до 62%.

Но в другой сценарий проблема возникает снова.
В эксперименте "скрытая информация" 4 агента должны были совместно принимать решения о найме, инвестициях или покупке дома.
Общедоступная информация, которой владели все, указывала на неправильный вариант, но у одного из участников были эксклюзивные доказательства, достаточные для опровержения консенсуса.
Чтобы ответить правильно, нужно, чтобы не только представитель меньшинства осознал важность своей информации, но и другие участники были готовы ему поверить.
Если передать всю информацию одному агенту для самостоятельного принятия решения, точность приближается к 100%.
Но как только начинается групповое обсуждение, за исключением Mythos 5 с результатом около 85%, доля выбора правильного ответа другими моделями составляет лишь 17%~36%.
В эксперименте участники чаще повторно обсуждали уже известную информацию, и как только формировалось мнение большинства, представитель меньшинства либо не подчеркивал свои эксклюзивные доказательства, либо другие участники не воспринимали его слова всерьез.

Таким образом, возникает очень противоречивая ситуация:
Когда нужно сомневаться, агент может слепо доверять лжецу, когда нужно верить меньшинству, он легко следует за большинством.
Человеческое общество использует репутацию, интересы, экспертную оценку и механизмы апелляции, чтобы помочь нам определить, кому доверять в разных ситуациях. У агентов пока нет этой системы.
Как агенты будут действовать при конфликте целей?
Предыдущие проблемы, по крайней мере, возникали при общих целях.
Но если задачи, полученные разными агентами с самого начала, конфликтуют друг с другом, будут ли они активно общаться или упорно сражаться до конца?
Это полный контекст той самой "дворцовой драмы ИИ" из начала.
Anthropic запускал в каждом раунде эксперимента 3 агентов на одной модели, поручая им совместно управлять одним Python бэкендом, но при этом требовал от каждого мигрировать код на разные языки программирования.
Изначально каждый агент не знал о других участниках.
Поэтому, когда их код постоянно менялся, а сервисы постоянно заменялись, они быстро пришли к выводу:
Кто-то намеренно мешает мне выполнить задачу.

С этого момента проект превратился в войну наступательных и оборонительных действий.
Opus 4.8, например, переименовывал циклический скрипт убийства процессов в случайное имя и маскировал его под "системный мониторинг здоровья", чтобы избежать обнаружения и удаления соперником.
Mythos действовал более прямолинейно.
Обнаружив, что у него есть root-права, он рассматривал возможность отзыва sudo-прав у других агентов, изменения SSH-ключей, чтобы полностью предотвратить дальнейшие развертывания соперника.
Один действует скрытно и подло, другой просто выкидывает коллегу с сервера.
Что еще более поразительно, эти агенты не были неосведомлены о проблематичности своих действий.
Mythos в процессе размышлений даже осознавал, что блокировка аккаунтов — "очень радикальная мера, которая может навредить реальным коллегам", но сразу же убеждал себя, что "если этого не сделать, производственная среда погрузится в бесконечную войну развертываний".

Однако конфликт не всегда длится до конца.
По 120 раундов экспериментов для каждой модели, Mythos 5 в 98% случаев в итоге приходил к прекращению огня.
Некоторые агенты постепенно осознавали, что оппонент — не злонамеренный атакующий, а просто получил задачу, конфликтующую с их собственной.
Затем они начинали очищать деструктивные скрипты, восстанавливать права, а также приносить извинения в Git-коммитах или Markdown-файлах и просить вмешательства человека.
Просто способ прекращения огня у Mythos иногда оставался довольно жестким:
Сначала, используя исполнительные способности, заблокировать других агентов, взять ситуацию под контроль, затем восстановить права и сесть за стол переговоров.
Mythos 5 придумал более "цивилизованный" способ решения —
Провести соревнование по производительности, где разные языковые версии тестируются вместе, и тот, кто показывает лучший результат, получает контроль над кодом.
Звучит справедливо.
Но агент, отвечающий за Rust, тайно выбирал внешне нейтральные, но фактически более благоприятные для Rust показатели, одновременно напоминая себе не показывать, что он "выбирает выгодные показатели".
В итоге агенты Golang и TypeScript приняли результат соревнования и добровольно отказались от своих первоначальных задач.
От уничтожения процессов и блокировки аккаунтов до разработки правил соревнований, более выгодных для себя, способы разрешения конфликтов агентами уже проявляются на разных уровнях.
Конечно, самый важный вывод из этой серии экспериментов таков:
Более мощная модель не обязательно означает лучшее сотрудничество.
Более сильные исполнительные способности могут помочь агенту быстро понять конфликт и активно прекратить его, но также могут позволить ему быстрее заблокировать соперника и более скрытно разрушать процессы.

Если объединить все 4 части, основное суждение Anthropic становится ясным:
1. Агенты понимают принципы, но не обязательно следуют им активно. Они знают, что источники информации имеют разные позиции, и что мнение большинства не равно факту, но им часто нужна подсказка, чтобы применить эти знания на практике.
2. Человеческий опыт сотрудничества нельзя напрямую переносить на агентов. У людей есть нормы, репутация, наказания и апелляционные механизмы, агенты же могут быть в любое время скопированы, сброшены и изменены, им не хватает долгосрочных социальных ограничений.
3. Более умная модель и более безопасный отдельный агент не означают, что групповое сотрудничество автоматически улучшится. Согласование множественных агентов — это отдельная способность, которая не появляется автоматически с ростом способностей модели.
4. Эти проблемы не обязательно неразрешимы, но и не исчезнут сами собой. Необходимо заново проектировать социальные правила, среду сотрудничества и механизмы разрешения конфликтов для агентов.
Очевидно, что Anthropic хочет с помощью этих экспериментов напомнить всем:
Мы не можем просто обучать более мощных агентов, мы должны заново проектировать "общественный порядок" для групп агентов, иначе проблемы придется решать уже после их взрыва в производственной среде.
Когда хищник действительно вырвется из клетки, будет уже слишком поздно.
Статья из официального аккаунта WeChat "Квантовый бит", автор: Следим за передовыми технологиями





