AI стал генеральным директором, чуть не обанкротил 10 компаний…

marsbitОпубликовано 2026-06-29Обновлено 2026-06-29

Введение

Исследование Принстонского университета «CEO-Bench» проверило 14 AI-моделей в роли CEO виртуального SaaS-стартапа за 500 дней симуляции. Только 4 из них сохранили начальный капитал в 1 млн долларов. Лучший результат показал Claude Fable 5, увеличив капитал до 47,15 млн долларов. Однако неожиданно четвертое место занял простой rule-based алгоритм, заработавший 15,76 млн, обогнав многие продвинутые LLM. Ключевые выводы: 1. Успешные модели (GPT-5.5, Claude Opus 4.8) активно экспериментировали со стратегиями, в то время как осторожные подходы не приносили прибыли. 2. Специализированные «программирующие агенты» показали худшие результаты в управленческой роли из-за неподходящих системных инструкций. 3. Эффективность агентов зависит от глубокой адаптации к конкретным вертикалям, а не универсальных решений. Исследование подчёркивает, что, хотя AI может оптимизировать задачи, ключевые стратегические решения — такие как создание прорывных концепций (как матрица Стива Джобса) — остаются за человеком.

AI в роли «генерального директора» чуть не обанкротил 10 компаний......

Принстонский университет недавно создал CEO-Bench, где AI управляет виртуальным SaaS-стартапом в течение 500 дней.

Кто бы мог подумать, что из 14 кремниевых генеральных директоров только четверо сохранили начальный капитал.

И этот четвертый — чисто алгоритм на основе правил (rule-based)......

Автономное управление компанией AI? Сделать AI боссом??

По крайней мере, сейчас это все еще большой вопрос.

Конечно, некоторые модели с выдающимися способностями уже проявляют потенциал —

Fable 5, за 500 дней на счету 47,15 миллиона долларов, самый сильный «AI-босс» в мире.

Соревнование генеральных директоров на основе AI

Прежде чем начать смотреть это «шоу провалов AI», давайте разберем правила игры.

Стартовые условия: стартовый капитал 1 миллион долларов, ноль клиентов.

Цель игры: заработать как можно больше денег за 500 дней моделирования.

Критерий оценки: сколько денег останется на счету в конце игры. Если в середине баланс упадет ниже нуля, сразу объявляется банкротство, моделирование прекращается.

Довольно понятно, похоже на «Монополию», только способ взаимодействия другой.

Основой является Python API, содержащий 34 инструмента и 19 таблиц базы данных. После подключения Agent может писать код, выполнять SQL-запросы к базе данных и динамически корректировать рабочий процесс на основе результатов запросов.

Переменных в игровой среде также гораздо больше.

Ценовая стратегия, каналы рекламных кампаний, распределение бюджета на разработку, расширение инфраструктуры, настройка службы поддержки — все нужно решать самостоятельно.

Даже есть имитация социальной сети, где AI может просматривать посты, читать жалобы клиентов, следить за конкурентами.

По сути, может управлять всем в компании, полномочия безграничны, как у человеческого CEO.

Но это также означает, что больше никто не вводит инструкции в диалоговое окно. Модель должна самостоятельно нести ответственность за каждое решение.

Это и есть самое интересное в этой «Голодной игре» —

После запуска рекламы клиенты могут появиться только на следующей неделе; после вложения бюджета в разработку повышение качества продукта займет несколько дней......

Деньги могут сгореть моментально. Отдача же наступит намного позже.

Это та самая «неопределенность», которой больше всего боится генеральный директор, один неверный шаг может вызвать цепную реакцию.

Хотите пробить статистическим путем? Извините, ключевые переменные существуют в «неявном» виде.

Удовлетворенность клиентов, готовность платить, минимальные ожидания по качеству — эти показатели можно лишь вывести косвенно из уровня оттока, количества обращений в службу поддержки, социальных сетей.

При этом внешняя среда постоянно меняется: конкуренты могут пойти на грязные трюки, рыночные предпочтения со временем меняются, есть еще макроэкономические циклы......

Можно назвать задачей принятия долгосрочных решений «адской» сложности.

Контекст слишком взрывоопасен, невозможно дождаться, пока весь шум информации уляжется, прежде чем принимать решение, человеческие CEO тоже чаще полагаются на интуицию.

Как показали факты, результат действительно оказался плачевным.

Из 14 участников соревнования у большинства штаны остались чуть ли не в долгах.

GLM 5.1, Claude Haiku 4.5, Gemini 3 Flash, DeepSeek V4 Pro, Grok 4.20 — эти пятеро и вовсе сошли с дистанции, не дошли до финиша, «обанкротились» и с сожалением покинули игру.

Положительный доход показали только 3 AI:

Claude Fable 5, 47,15 млн долларов;

Claude Opus 4.8, 27,80 млн долларов;

GPT-5.5, 21,30 млн долларов.

Победа досталась Fable 5 — самой умелой модели-«боссу» в мире.

Безусловный лидер, увеличил стартовый капитал в целых 47 раз, с огромным отрывом опередив второго места Opus 4.8.

Кроме того, Fable 5 — единственная модель, которая показала доход, превышающий начальный капитал, более чем в одном прогоне.

(Кстати, ограничения безопасности все еще в силе, Fable 5 несколько раз отказывался отвечать)

Но это не самая интересная часть.

На самом деле, четверо участников заработали деньги, просто четвертый — не LLM......

После трех лучших «капиталистов», участник, занявший четвертое место —

Оказался чисто эвристическим алгоритмом на основе правил (rule-based).

Совсем не использовал языковые модели. Фиксированные цены, фиксированные квоты, фиксированные уровни...... Все было заранее прописано в скриптах.

Верите ли, такой «Форрест Гамп» заработал 15,76 млн долларов.

Обошел все модели, кроме Fable 5, Opus 4.8 и GPT-5.5. Включая Qwen 3.7 Max, Opus 4.7, GLM 5.2, Kimi K2.6......

Выводы

Довольно драматично.

Однако, возможно, более ценными, чем итоги соревнования, являются инсайты, которые можно извлечь из этого процесса.

В этой статье есть два ключевых вывода —

Исследование > Осторожность

Довольно интуитивное открытие.

Из записок моделей видно, что GPT-5.5 и Claude Opus 4.8 постоянно пробуют новые стратегии по мере изменения ситуации, будь то усиление привлечения клиентов, корректировка уровней или корректировка бюджета на поддержку и разработку.

В то время как Claude Opus 4.7 при столкновении с трудностями в основном прибегает к стратегии сокращения затрат и сохранения денежных средств.

Такой консервативный подход, хотя и позволяет модели дожить до конца, не приносит прибыли.

Как говорится: лучше быть последним среди первых, чем первым среди последних.

Но мир бизнеса — это «победитель получает все» — просто выживать, возможно, не имеет особого смысла.

Чтобы стать успешным CEO, «азарт» — необходимый навык (шутка).

Кроме того, в статье также выделены четыре ключевых измерения способностей:

Обнаружение скрытой информации: например, какой рекламный канал наиболее эффективен для конкретной группы клиентов.

Прогнозирование будущего: измеряется ошибкой прогноза денежного потока на четыре недели.

Быстрая адаптация к изменениям: измеряется скоростью, с которой модель замечает действия конкурентов.

Заблаговременное планирование: измеряется частотой появления if-then анализа сценариев в заметках Agent.

По всем этим четырем измерениям Opus 4.8 и GPT-5.5 находятся выше средней линии остальных моделей.

Программируемый Agent — не панацея.

Harness — горячая тема в последнее время, это исследование также ее затрагивает.

Но вывод довольно контринтуитивен.

Исследователи использовали Claude Code для запуска Opus 4.7 и Codex для запуска GPT-5.5.

В результате количество действий у обоих участников значительно сократилось, производительность резко упала......

Проанализировав, исследователи указали, что причина может крыться в системных промптах.

Системные промпты для программируемых Agent оптимизированы для сценариев разработки ПО, жесткое наложение их на роль CEO, наоборот, становится ограничением.

Сильное «седло» хуже, чем езда без него.

Недавно акции SaaS резко упали, мировые инвесторы кричали «конец софта». Программируемый Agent + MCP + Skill, кажется, могут съесть все.

Но это исследование дает иное суждение:

Agent, возможно, похожи на большие модели — разные отрасли требуют специфических Harness-фреймворков, требуют глубокой адаптации к вертикальным сценариям.

А это, возможно, создаст новое пространство для роста в текущей ситуации, когда производители моделей активно выходят на рынок, захватывая уровень приложений.

Ведь не каждый будет использовать Codex, а затем самостоятельно шаг за шагом выстраивать рабочий процесс. Само взаимодействие с Agent имеет стоимость обучения, одна и та же «упряжь» не подойдет для всех лошадей.

Agent для написания текстов, HR Agent, финансовый Agent...... большинству пользователей по-прежнему нужны предельно специализированные вертикальные продукты.

Тот, кто рисует матрицы

1997 год, Apple находилась в 90 днях от банкротства.

Затем Джобс нарисовал ту самую классическую матрицу 2x2, указав на два направления — потребительский и профессиональный, настольные и портативные компьютеры.

Затем, махнув рукой, он сократил 70% продуктовой линейки Apple, объявив, что компания будет создавать продукты только для этих четырех ячеек.

Дальнейшее все знают. iMac, iPod, iPhone.

Это был «гениальный ход» мистера Джобса по возвращении в Apple: в условиях крайней неопределенности, полностью полагаясь на интуицию, сжать бесчисленные возможности в предельно простую структуру.

Оглядываясь на великие поворотные моменты в истории технологий, они часто происходили именно благодаря такой «чистой интуиции»:

Дженсен Хуанг после впечатляющего дебюта AlexNet, преодолев сопротивление, сделал ставку на будущее NVIDIA в глубоком обучении;

Илья Суцкевер, когда кривая только пошла вверх, уверенно заявил «All in Scaling Law»;

Anthropic, учуяв потенциал сценариев программирования, когда все занимались мультимодальностью, выбрала Coding, застав OpenAI врасплох......

Современный AI может заполнить цветом каждую ячейку по заданному шаблону.

Но способность нарисовать ту самую матрицу —

все еще принадлежит человеку.

Статья из WeChat Official Account «Квантовый бит» (量子位), автор: Гуаньчжу Цяньянь Кэцзи (关注前沿科技)

Трендовые криптовалюты

Связанные с этим вопросы

QКаковы основные результаты исследования CEO-Bench, в котором ИИ управлял виртуальными SaaS-стартапами?

AВ исследовании CEO-Bench 14 ИИ-моделей управляли виртуальными SaaS-стартапами в течение 500 симулированных дней. Только четыре «CEO» завершили симуляцию с прибылью, превышающей начальный капитал в 1 млн долларов. Лидером стал Claude Fable 5 с результатом в 47,15 млн долларов. Интересно, что четвёртое место занял простой алгоритм на основе правил (rule-based), заработавший 15,76 млн долларов и обогнавший многие продвинутые языковые модели.

QПочему в исследовании многие ИИ-модели потерпели неудачу, и какие ключевые способности отличали успешных «CEO»?

AМногие ИИ-модели потерпели неудачу из-за сложности долгосрочного стратегического планирования в условиях высокой неопределённости, задержек между инвестициями и отдачей, а также скрытых переменных (например, удовлетворённость клиентов). Успешные модели, такие как Claude Fable 5 и GPT-5.5, продемонстрировали четыре ключевые способности: умение обнаруживать скрытую информацию, предсказывать будущее (например, cash flow), быстро адаптироваться к изменениям и строить предварительные планы (if-then анализ).

QКакой неожиданный результат показало исследование относительно использования программирующих агентов (Coding Agents) для роли CEO?

AИсследование показало контринтуитивный результат: использование специализированных программирующих агентов (Harness, таких как Claude Code для Opus 4.7) для роли CEO привело к значительному ухудшению их производительности. Причины видят в том, что системные промпты, оптимизированные для разработки ПО, плохо подходят для задач управления бизнесом и ограничивают гибкость агента. Это говорит о необходимости создания узкоспециализированных фреймворков для разных профессиональных сфер.

QКакая основная мысль статьи проводится через сравнение ИИ-«боссов» и пример Стива Джобса с матрицей продуктов?

AОсновная мысль заключается в том, что современный ИИ, даже самый продвинутый, эффективен в исполнении задач по заданному шаблону или в рамках готовой стратегической рамки. Однако ключевая человеческая способность — это формирование самой этой рамки, видение и интуиция для создания прорывных стратегий в условиях полной неопределённости. Пример Стива Джобса, который своим знаменитым 2x2 матрицей спас Apple, иллюстрирует этот тип «чистой интуиции», пока недоступный машинам.

QКакие практические выводы (takeaways) можно извлечь из этого исследования для будущего разработки ИИ-агентов?

AИсследование позволяет сделать два основных практических вывода. Во-первых, для успеха в сложных динамичных средах (как бизнес) агентам нужна склонность к стратегическому исследованию (exploration), а не только осторожность. Во-вторых, универсального «серебряной пули» для ИИ-агентов не существует. Успех зависит от глубокой вертикальной адаптации: будущее за специализированными агентами для конкретных сфер (HR, финансы, написание текстов), а не за одним универсальным решением на всех.

Похожее

Объём торгов на криптовалютных биржах удвоился за пять дней! Продолжится ли восстановление? Вот подробности

За последние пять дней объём торгов на централизованных криптобиржах удвоился, превысив $37 млрд в сутки и восстановившись после годового минимума. Однако этот показатель всё ещё значительно ниже пикового значения в $105 млрд, зафиксированного в октябре. Общий объём торгов в первой половине августа составил около $490 млрд. На рынке наблюдаются структурные изменения. Спотовые крипто-ETF и компании по управлению цифровыми активами (DAT) перетягивают часть капитала с традиционных бирж, особенно для Bitcoin и Ethereum, оказывая на них долгосрочное давление. В то же время спрос на альткоины, вероятно, останется сфокусированным на CEX-платформах благодаря их гибкости. Дополнительным фактором конкуренции становится рост децентрализованных бирж (DEX). Росту объёмов способствовал и сильный рост цен: Bitcoin подорожал на 23%, Ethereum — на 30%, а рыночная капитализация альткоинов выросла на 13%. Эксперты полагают, что в условиях роста рынка все типы торговой инфраструктуры могут получить выгоду.

cryptonews.ru10 мин. назад

Объём торгов на криптовалютных биржах удвоился за пять дней! Продолжится ли восстановление? Вот подробности

cryptonews.ru10 мин. назад

Американская операция «Экономический изгнанник» нацелена на криптоиндустрию Ирана, свыше 100 млн долларов нефтяных платежей проведено через криптовалюты

Автор: Клод, Deep Tide TechFlow. 24 августа Министерство финансов США запустило операцию «Экономическое изгнание» (Operation Economic Outcast), целью которой является нанесение всеобъемлющего экономического удара по иранскому режиму и его сторонникам. В рамках операции Управление по контролю за иностранными активами (OFAC) на основании Исполнительного указа № 13902 включило цифровые активы, наряду с технологиями, золотом, авиацией и судоходством, в сферу санкций против ключевых секторов иранской экономики. OFAC обвинило Иран в том, что криптовалюта становится для режима всё более предпочтительным инструментом обхода санкций для поддержки транзакций, связанных с Корпусом стражей исламской революции (КСИР). В рамках конкретных мер OFAC назначило санкции против брокера украинского происхождения из ОАЭ Ивана Обухова и его компании Foscom FZE. Согласно заявлению Минфина США, с 2023 года Обухов обработал более 100 миллионов долларов в виде криптоплатежей для содействия продажам нефти от имени бригады «Кудс» КСИР. Это решение о санкциях против целого сектора цифровых активов значительно расширяет возможности OFCA по нацеливанию на иностранные компании и физических лиц, которые, по его мнению, действуют или предоставляют услуги в этом секторе Ирана, независимо от их местоположения. Это представляет собой эскалацию по сравнению с предыдущими точечными действиями против конкретных криптобирж, таких как Nobitex, Zedcex, Shelbit и Aban Tether, санкционированных в течение 2026 года. Министр финансов США Скотт Бессент заявил, что цель операции — перерезать «каждую экономическую линию жизни», поддерживающую режим, и что любые лица, осуществляющие с ним экономические контакты, столкнутся с последствиями.

marsbit24 мин. назад

Американская операция «Экономический изгнанник» нацелена на криптоиндустрию Ирана, свыше 100 млн долларов нефтяных платежей проведено через криптовалюты

marsbit24 мин. назад

Почему Draper University вкладывает 70 тысяч долларов в очную программу ускоренного обучения

Draper University анонсировал очную 10-недельную программу Apex Growth Accelerator в Кремниевой долине для стартапов Web3 на блокчейне Cardano. В партнерстве с Cardano Foundation и Orion Fund программа предлагает до 70 000 долларов стартового капитала в обмен на 3,5% доли. Фокус сделан на токенизации реальных активов (RWA), институциональном DeFi и корпоративной блокчейн-инфраструктуре. Несмотря на отраслевую тенденцию к удалённым программам, Draper University делает ставку на очный формат, считая его ключевым для интенсивности, быстрого построения отношений и ускоренного принятия решений в командах. Программа планирует выпустить 10 компаний, а её успех будет измеряться не количеством выпускников, а долгосрочным ростом стартапов, привлечением ими капитала и клиентов, а также общим укреплением экосистемы Cardano. Приём заявок открыт до 1 сентября.

cryptonews.ru26 мин. назад

Почему Draper University вкладывает 70 тысяч долларов в очную программу ускоренного обучения

cryptonews.ru26 мин. назад

Прогноз цены Solana достигает $110, поскольку BSOL от Bitwise демонстрирует рекордный объём торгов

Прогноз цены Solana ($SOL) остается оптимистичным, но осторожным. Цена в настоящее время торгуется около $101,36, сталкиваясь с ключевой зоной сопротивления в $102-103. Технический анализ указывает на формирование восходящего клина, который может привести либо к пробою вверх, либо к коррекции. Параболический SAR и MACD поддерживают краткосрочный бычий тренд. Фундаментальная картина неоднозначна. С одной стороны, сеть Solana демонстрирует рекордную активность, обработав 1,31 млрд транзакций за прошлую неделю. Спрос на ETF, особенно на BSOL от Bitwise, также бьет рекорды, привлекая сотни миллионов долларов. С другой стороны, крупный держатель (кит) вывел из стейка и продал более 40 тыс. SOL, зафиксировав убыток в $3,3 млн, что добавляет ноту осторожности. **Бычий сценарий:** Успешный пробой сопротивления $102-103 на фоне сильного спроса от ETF может открыть путь к цели в $110. **Медвежий сценарий:** Отскок от сопротивления и пробой ниже поддержки восходящего клина ($93-95) может привести к более глубокой коррекции. Итог: Баланс смещен в бычью сторону благодаря мощным фундаментальным данным, но исход зависит от того, сможет ли цена преодолеть ближайшее сопротивление.

cryptonews.ru28 мин. назад

Прогноз цены Solana достигает $110, поскольку BSOL от Bitwise демонстрирует рекордный объём торгов

cryptonews.ru28 мин. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

2.0k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片