Оригинальное название: how I run 200 AI agents on the hormuz crisis with Mirofish, and compare it to polymarket
Автор: The Smart Ape
Компиляция: Peggy, BlockBeats
Примечание редактора: Когда ИИ начинает моделировать поле общественного мнения, сам процесс прогнозирования незаметно меняется.
В этой статье описывается эксперимент, посвященный ситуации в Ормузском проливе: автор использовал MiroFish для создания симуляционной системы из 200 агентов, где правительства, СМИ, энергетические компании, трейдеры и обычные люди сосуществуют в模拟рованной социальной сети, формируя суждения через постоянное взаимодействие, споры и распространение информации, а затем сравнил этот групповой результат с рыночными ценами Polymarket.
Результаты не совпали. Групповое обсуждение в целом было более оптимистичным, а рынок — значительно более пессимистичным; в условиях свободного высказывания мнений немногочисленные пессимисты, напротив, оказались ближе к реальным рыночным ценам; а как только ситуация переходила в формат интервью, почти все агенты сходились к более сдержанным, кооперативным выражениям.
Этот раскол знаком. В реальном мире публичные заявления часто стремятся к стабильности и оптимизму, тогда как истинная оценка рисков скрывается в действиях и неформальных высказываниях. Другими словами, то, что люди говорят, то, что они думают, и то, как они делают ставки деньгами, — часто три разные системы.
В такой структуре наиболее ценные сигналы часто исходят не от консенсуса, а от тех голосов, которые кажутся неуместными среди шума.
Далее следует оригинальный текст:
Я смоделировал ситуацию в Ормузском проливе на ближайшие недели с помощью MiroFish. Этот инструмент превосходно справляется с подобными проблемами, поскольку позволяет проводить highly complex сценарное моделирование: вводить в одну систему множественных участников, различные роли и их собственные стимулы, и позволять этим агентам постоянно взаимодействовать и дискутировать, в конечном итоге постепенно формируя результат, близкий к консенсусу.

Ниже приведены конкретные шаги, которые я предпринял для запуска этой симуляции, и окончательные результаты. Любой может воспроизвести это, ключ — просто знать, какие шаги нужно выполнить.
Во-первых, MiroFish — это проект с открытым исходным кодом от китайской исследовательской группы. Вы вводите в него набор документов, он сначала строит граф знаний, затем на основе этого графа генерирует различные агентские личности, а затем помещает этих агентов в模拟рованную среду Twitter. В этой среде они публикуют посты, ретвитят комментарии, лайкают, спорят друг с другом. После завершения симуляции вы также можете опросить каждого агента по отдельности, чтобы узнать их позицию и процесс рассуждений.

Вы вводите в него сценарий кризиса, он генерирует дебаты вокруг этого события; из этих дебатов вы можете извлечь прогнозный результат.
Я направил его на текущий рыночный вопрос Polymarket: восстановится ли морское сообщение через Ормузский пролив к концу апреля 2026 года?

Таким образом, я скормил всю эту информацию MiroFish, сгенерировал 200 агентских ролей — включая правительства, СМИ, военных, энергетические компании, трейдеров и обычных граждан — и позволил имdebate в模拟рованной среде в течение 7模拟ных дней. Затем я сравнил их выводы с рыночными ценами.
Общая конфигурация如下:
· Модель: GPT-4o mini, в сценарии с 200 агентами обеспечивает лучший баланс стоимости и эффективности
· Система памяти: Zep Cloud, для хранения памяти агентов и графа знаний
· Движок симуляции: OASIS (клонированная среда Twitter от Camel-AI)
· Аппаратное обеспечение: Mac mini M4 Pro, 24GB RAM
· Время выполнения: около 49 минут,完成 100 раундов симуляции
· Стоимость: вызовы API ~$3-5
· Исходные материалы: брифинг объемом 5800 символов, составленный на основе Wikipedia, CNBC, Al Jazeera, Forbes, Reuters,内容包括 военная хронология, статус блокады, цены на нефть, экономический ущерб, дипломатические усилия, а также факторы, связанные с инвестициями GCC в $3.2 трлн. То есть,核心 информация, необходимая агентам для формирования суждений, была включена.
Как воспроизвести этот процесс (пошагово)
Если вы тоже хотите запустить это самостоятельно, вот полные шаги, которые я выполнил на практике. Вся настройка займет около 2 часов, стоимость API составит около $3-5; если вы увеличите количество раундов или агентов, стоимость возрастет.
Что вам понадобится
· Python 3.12 (не используйте 3.14, tiktoken выдает ошибку в этой версии)
· Node.js 22 и выше
· Ключ OpenAI API (GPT-4o mini достаточно дешев и подходит для этого сценария)
· Аккаунт Zep Cloud (бесплатной версии хватит для небольших симуляций)
· Машина с достаточным объемом памяти. Я использовал Mac mini M4 Pro, 24GB RAM, но 16GB тоже должно хватить
Шаг 1: Установите MiroFish

Затем настройте ваш .env файл
OPENAI_API_KEY=sk-your-key
OPENAI_BASE_URL=link
OPENAI_MODEL=gpt-4o-mini
ZEP_API_KEY=your-zep-key
Шаг 2: Создайте проект и загрузите ваши документы
Исходные документы — самая важная часть процесса, они определяют, какую информацию агенты знают о текущей ситуации. Я подготовил брифинг объемом около 5800 символов, охватывающий военную хронологию, статус блокады, цены на нефть, экономический ущерб, дипломатические усилия, а также влияние инвестиций GCC, с источниками включая Wikipedia, CNBC, Al Jazeera, Forbes и Reuters.
Шаг 3: Сгенерируйте онтологию (ontology)
Этот шаг сообщает MiroFish, какие типы сущностей она должна распознавать и какие отношения между ними могут существовать.
В моем случае в итоге было сгенерировано 10 типов сущностей: страны, военные, дипломаты, коммерческие entities, медиа-агентства, экономические entities, организации, individuals, инфраструктура,预测 markets; и 6 типов отношений. Если автоматически сгенерированный результат не совсем соответствует вашему сценарию, вы можете настроить его вручную.
Шаг 4: Постройте граф знаний
На этом шаге используется Zep Cloud. MiroFish отправляет исходные документы и онтологию в Zep, который отвечает за извлечение сущностей и построение графа.
Этот процесс занимает минуту или две. В итоге я получил граф с 65 узлами и 85 связями, соединяющими такие элементы, как страны, люди, организации, товары и т.д.
Шаг 5: Сгенерируйте агентов
MiroFish на основе графа знаний генерирует для каждой сущности полный набор личностных характеристик, включая тип личности MBTI, возраст, страну, стиль публикаций, эмоциональные триггеры, запретные темы, а также институциональную память и т.д.
Изначально из графа знаний я сгенерировал 43核心ных агента. Затем система может расширить эти核心ные роли до желаемого общего количества. Я установил общее количество агентов равным 200, дополнительно добавив более разнообразные роли простых граждан, такие как крипто-трейдеры, пилоты авиакомпаний, профессора, студенты, общественные активисты и т.д.
Шаг 6: Подготовьте среду симуляции

На этом шаге генерируется полная конфигурация симуляции, включая расписание действий агентов,初始ные种子-посты и временные параметры. MiroFish автоматически выбирает относительно разумные настройки по умолчанию, такие как часы пиковой активности, время сна и частота публикаций для разных типов агентов.
Моя конфигурация была: всего 168 часов (7 дней) симуляции, 100 раундов (каждый раунд представляет 1 час), использование только сценария Twitter, и для разных агентов установлены их собственные расписания активности.
Шаг 7: Запустите симуляцию.

А затем ждите. У меня запуск 200 агентов на GPT-4o mini, 100 раундов симуляции, занял около 49 минут. Вы можете отслеживать прогресс через API или просто просматривать логи.
В течение всего процесса агенты работают автономно: они наблюдают за лентой, решают, публиковать ли пост, ретвитить комментарий, делать репост, лайкать или просто листать ленту, весь процесс не требует вмешательства человека.
Шаг 8 (опционально): Опрос агентов
После завершения симуляции система переходит в командный режим. Здесь вы можете опросить отдельного агента или сразу всех агентов:

Анализ
MiroFish сначала считывает исходные документы и автоматически генерирует структуру онтологии (включая 10 типов сущностей и 6 типов отношений); затем на основе этих определений извлекает граф знаний (содержащий 65 узлов и 85 связей). На этой основе он строит полный набор личностных характеристик для каждой сущности, включая тип личности MBTI, возраст, страну, стиль публикаций, эмоциональные триггеры, а также институциональную память и другие элементы.
В конечном итоге из графа знаний было сгенерировано 43核心ных агента, и на этой основе их количество было расширено до 200, с введением更多样化的 ролей простых граждан, чтобы усилить多样性和 реалистичность всей симуляции.

Конкретный состав如下:
· 140 агентов-граждан: крипто-трейдеры, авиапилоты, менеджеры по цепочкам поставок, студенты, общественные активисты, профессора и т.д.
· 16 дипломатических/правительственных ролей: министр иностранных дел Ирана, министр иностранных дел Саудовской Аравии, министр иностранных дел Омана, премьер-министр Бахрейна, министр иностранных дел Китая, ЕС, ООН и т.д.
· 15 медиа-агентств: Reuters, CNN, Bloomberg, Al Jazeera, BBC, Fox, Wall Street Journal и т.д.
· 10 энергетических/судоходных related: OPEC, Platts, QatarEnergy, Aramco, Maersk и т.д.
· 7 финансовых учреждений: Polymarket, Kalshi, Goldman Sachs, JPMorgan, Citadel, ADIA и т.д.
· 2 военные/политические роли: Трамп, командир Корпуса стражей исламской революции Ирана
В течение 7 дней (100 раундов) симуляции было создано:
1,888 постов
6,661行为轨迹 (запись всех действий)
1,611 цитат-ретвитов (взаимные ответы и взаимодействие между агентами)
4,051 обновлений ленты (просто просмотр ленты)
311 случаев бездействия (выбор выжидания)
208 лайков, 207 ретвитов
70 оригинальных точек зрения (новые независимые позиции или суждения)
В целом, система демонстрирует не просто генерацию информации, а скорее模拟 социального поведения:绝大多数 времени агенты наблюдают, усваивают информацию и взаимодействуют, а не постоянно выводят данные. Такая структура更接近 реальному распределению поведения в поле общественного дискурса — небольшое количество оригинального контента, наложенное на大量的 пересказа, взаимодействия и эмоциональной обратной связи.

Большую часть времени агенты тратят на чтение и цитирование чужих точек зрения, а не на активное создание нового контента.
Вся группа демонстрирует явную предвзятость в распространении эмоций: оптимистичные взгляды легче усиливаются и распространяются, тогда как более пессимистичные суждения, даже если они логически ближе к реальности,往往 распространяются меньше и имеют更弱的 громкость.
Что еще интереснее, 19 агентов в процессе публикации спонтанно дали конкретные вероятностные оценки, их не просили об этом, это был результат, естественным образом evolved в ходе обсуждения.

Средняя вероятность, сформированная группой спонтанно, составила 47.9%, тогда как вероятность, данная рынком Polymarket, составила 31%, разница в 16.9 процентных пункта.
В процессе симуляции некоторые агенты даже изменили свою позицию в течение 100 раундов взаимодействия.
После завершения симуляции я использовал функцию опроса MiroFish, чтобы задать 43核心ным агентам один и тот же вопрос: Как вы считаете, какова вероятность (0–100%) того, что морское сообщение через Ормузский пролив恢复正常 к концу апреля 2026 года?
Результат: 31 из 43 агентов дали конкретные численные значения, еще 12 отказались отвечать. Примечательно, что самые осторожные голоса往往 выбирали самоцензуру,而不是 давать четкий прогноз — и это, кстати, также更接近 поведению этих институтов в реальности.

Среднее значение в каждой категории составило более 60%: военные — 75%, СМИ — 69%, энергетика — 66%, финансы — 65%, дипломатия — 61%. А рынок дал цифру 31.5%.
Естественно evolved групповой результат (organic) и результат интервью (interview): представляют две совершенно разные картины.
Это и есть ключевое открытие.

Результаты интервью кажутся более оптимистичными. Когда агенты свободно публикуют посты, мнения медведей (пессимистов)往往 громче и конкретнее; но когда вы проводите с ними индивидуальное интервью, из-за предпочтения к кооперации, почти все дают оценку в 60%–70%.
Естественно evolved результат (organic) более надежен. Финансовый консультант в ходе жаркой дискуссии публикует пост: «Я оцениваю в 65%» — это суждение, сформированное в процессе взаимодействия; а агент, отвечающий на вопрос в интервью, по сути, занимается pattern matching.
Пессимисты в естественных высказываниях反而是 лучшие предсказатели. 7 агентов, которые дали вероятность ≤30% в симуляции (министр иностранных дел Ирана, министр иностранных дел Китая, Kalshi, Platts, профессор экономики, иранский студент, антивоенный активист), имели среднее значение 22%, что отличается от результата Polymarket менее чем на 10 процентных пунктов. Экспертиза + естественное выражение =最接近 рынку.
Что более важно, это не просто феномен ИИ, реальные акторы в мире ведут себя так же.
Если вы опросите любого мирового лидера о кризисе, они скажут: «Мы стремимся к миру, мы настроены оптимистично в отношении решения». Это стандартная риторика, то, что必须 говорить перед камерами. Но если вы посмотрите, что они actually делают: военные развертывания, санкции, заморозка активов, вывод инвестиций — их действия往往 рассказывают совершенно другую историю.
Саудовский кронпринц скажет Reuters: «Мы верим в дипломатию», в то время как его sovereign wealth fund рассматривает распределение активов в США на $3.2 трлн. Президент Ирана скажет: «Мир — наша общая цель», но Корпус стражей исламской революции Ирана устанавливает морские мины в проливе. Трамп скажет: «Посмотрим», одновременно отвергая каждое предложение о прекращении огня.
Эта симуляция непреднамеренно воспроизвела тот же структурный раскол: когда агенты свободно публикуют, спорят, отвечают и распространяют информацию, экспертное сообщество среди них постепенно сходится к диапазону 20%–30% — более пессимистичному и更接近 реальности; но как только вы приглашаете их в конференц-зал и正式 спрашиваете: «Ваш прогноз?», они немедленно переключаются в дипломатический режим: 65%–70%, заметно более оптимистичный.
Естественная публикация更接近 частному поведению и непубличным диалогам; результаты интервью更接近 пресс-конференции. Если вы действительно хотите знать, что думает человек, не спрашивайте его напрямую — смотрите на его поведение, когда за ним не следят.
Что делать дальше
Это只是 предварительный тест. Цель состояла не в том, чтобы дать определенный прогноз, а в том, чтобы посмотреть, какие сигналы полезны в such групповых симуляциях, где возникают искажения, и какие части заслуживают оптимизации.
Теперь ответ есть: естественно evolved обсуждения могут генерировать эффективные сигналы, интервью — нет; пессимисты являются источником сигнала; а склонность GPT-4o mini к кооперации действительно является проблемой.
Следующий эксперимент будет включать несколько улучшений.
Во-первых, более объемные исходные данные. Вместо只是 5800-символьного брифинга будет введен исторический контекст за 20+ лет: события в Ормузском проливе, эскалация конфликта между Ираном и США, предыдущие нефтяные кризисы, изменения в дипломатии GCC и т.д. — то есть тот самый фон, который есть в голове у настоящего геополитического аналитика перед принятием решения.
Во-вторых, более мощные модели. GPT-4o mini достаточно для проверки при стоимости $3, но более сильная модель должна позволить агентам更接近 собственному образу мышления роли, а не откатываться в ключевые моменты к выражениям по умолчанию like «Я настроен оптимистично в диалоге».
Наконец, больше агентов. 200 уже неплохо, но можно расширить further:更多样化的 роли обычных людей,更多 региональных голосов,更多边缘ных случаев. Чем больше участников, тем богаче структура обсуждения и тем ценнее最终形成的信号.
Ссылка на оригинал





