Большие модели сокрушили все экзамены, но отдалились от ИИ общего типа: что разоблачила эта статья?

marsbitОпубликовано 2026-05-28Обновлено 2026-05-28

Введение

Если вам скажут, что Искусственный Общий Интеллект (ИОИ) уже достигнут, как определить, правда это или преувеличение? Проблема в том, что для ИОИ не существует общепризнанного критерия. Как отмечает исследователь Беннетт в своей работе, концепция ИОИ стала подобна тесту Роршаха — каждый видит в ней своё. В 2025 году научное сообщество активно пытается определить новые рамки. Беннетт предлагает радикальный и практичный подход: перестать мерить ИОИ по сходству с человеком и определять его как «искусственного учёного». Ключевым критерием должна стать не имитация, а способность к адаптации и открытию нового знания в условиях ограниченных вычислительных ресурсов, памяти и энергии. Почему нужен новый стандарт? Потому что существующие тесты, такие как тест Тьюринга или академические экзамены, уже пройдены большими языковыми моделями, но это не приблизило нас к подлинному общему интеллекту. Модели, основанные на Scale-maxing (максимизации масштаба), просто хранят в своих весах приблизительные ответы на основе огромных данных. Они пассивны, не понимают причинно-следственных связей и беспомощны перед новыми, непредвиденными задачами — например, могут ошибочно утверждать, что 9.11 больше 9.9. Беннетт разбивает поведение настоящего ИОИ на ключевые принципы, аналогичные работе учёного: 1) Активное экспериментирование (вместо пассивного обучения), 2) Понимание причинности (а не просто корреляций), 3) Способность балансировать между «исследованием» нового и «использованием» известного. ...

Если кто-то скажет вам, что ИИ общего типа (ИОТ) уже достигнут, как вы определите, говорит ли он правду или хвастается?

В секретном соглашении, раскрытом OpenAI и Microsoft, этой мерой стала финансовая отчётность — ИИ-система, способная приносить не менее 100 млрд долларов прибыли, считается ИОТ. Во рту у Цзэн Жэньсюня этой мерой стало время — обязательно появится в течение пяти лет; Илон Маск неоднократно делал предсказания о «достижении в следующем году».

То, что лидеры отрасли говорят каждый своё, коренится не в том, кто лжёт, а в том, что у самого понятия ИОТ нет общепризнанной мерки. Как сказал в своей статье Беннетт, независимо мыслящий исследователь в области ИОТ, ИОТ из-за спекуляций и домыслов превратился в «тест Роршаха» — каждый видит лишь собственное представление, а не объективный факт; а учёный из Института Санта-Фе Мелани Митчелл считает, что эту дискуссию можно прояснить только путём долгосрочных научных исследований. (Адрес статьи: https://arxiv.org/pdf/2503.23923)

Это самая абсурдная дилемма, с которой сегодня сталкивается индустрия ИИ: мы мчимся на полной скорости, преследуя цель, у которой даже не начерчена финишная черта.

2025: кто заново чертит стартовую линию для ИОТ?

Столкнувшись с таким вакуумом определений, академическое сообщество в 2025 году начало активно «заполнять пробелы». Бенджио и другие учёные подчеркивают «многофункциональность» и «мастерство»; DeepMind предлагает «распределённый ИОТ», пытаясь разрушить миф о едином всемогущем агенте.

Но Майкл Тимоти Беннетт, исследователь из Австралийского национального университета, в статье, загруженной на arXiv в конце марта, дал провокационный и в то же время самый точный ответ.

Он указал, что предыдущие определения, ходя по кругу, всё ещё зациклены на сравнении с «образованным взрослым человеком». Беннетт принимает определение интеллекта учёного Пэй Вана — рассматривая интеллект как способность к адаптации при ограниченных ресурсах — фундаментально выходит за рамки концепции «похожести на человека» и определяет ИОТ как «искусственного учёного».

Он предлагает, что настоящий ИОТ должен быть системой, способной, подобно человеческому учёному, широко, эффективно и научно адаптироваться к новым средам и задачам в рамках реальных ограничений по вычислениям, памяти и энергии.

Скрытый смысл этой фразы таков: стандарт оценки ИОТ должен заключаться не в том, насколько хорошо он имитирует человека, а в том, насколько сильна его способность «открывать новое знание».

Почему срочно нужна новая мерка? Потому что старые мерки — тест Тьюринга и тесты на основе человеческих эталонов — уже сокрушены большими моделями, но мы всё дальше от истинного общего интеллекта.

В 2025 году, если вы спросите у передовой большой модели, «что больше: 9.11 или 9.9», она всё ещё может с уверенностью сказать вам, что 9.11 больше, потому что 11 больше 9. При решении сложных доказательств математических неравенств, даже если большая модель угадает правильный ответ, процесс рассуждений часто оказывается логически несостоятельным.

Беннетт метко указал на причину болезни: текущие большие модели идут по пути «максимизации масштаба для аппроксимации» — используют огромные объёмы данных и вычислительные мощности, чтобы заранее сохранить приблизительные ответы на различные задачи в весах сети. Как только они сталкиваются с проблемой вне распределения обучающих данных, они сразу же выдают себя.

Что ещё более критично, у больших моделей нет «активных способностей». Они не могут активно ставить эксперименты для проверки гипотез, не могут автономно выстраивать причинно-следственные цепочки, и не могут взвешивать компромисс между «продолжением исследования» и «использованием известного».

Возвращаясь к сравнению 9.11 и 9.9 — большая модель не не умеет считать, а просто у неё нет построенной причинно-следственной модели сравнения чисел. Она лишь использует вероятность, чтобы угадать тот фрагмент текста, который она видела и который наиболее похож.

Пропасть между «способностью к имитации» и «способностью к адаптации» — это именно то, что новый стандарт ИОТ хочет измерить.

Новая шкала интеллекта: разбор «искусственного учёного»

Эта система стандартов Беннетта заслуживает внимания потому, что он свел ИОТ с расплывчатой философской проблемы до измеряемой инженерной задачи.

По его мнению, поведение настоящего ИОТ должно идеально соответствовать исследовательской парадигме человеческого учёного:

Во-первых, от «марионетки» до «активного экспериментатора».

Сегодняшний ИИ — абсолютно пассивный ученик, который может только «смотреть» на данные, которые ему скармливает человек. Но учёный — нет. Если учёный окажется запертым в незнакомой комнате, он не будет стоять на месте в ожидании информации, а пойдёт толкать дверь, тянуть ручку, проверять окна — это и есть «активный эксперимент». Настоящий ИОТ должен уметь автономно планировать эксперименты, получая ключевую информацию через активное взаимодействие.

Во-вторых, от «знания, что» к «знанию, почему».

Это самое большое слабое место современного ИИ. Большие модели — крайние «корреляционные ученики». Они знают, что «дождь» часто сопровождается «мокрой землёй», но не знают, что вызывает что. Только понимая причинно-следственные связи, можно понять, что когда ясно и солнечно, но земля мокрая, следует сделать вывод о проезде поливальной машины, а не о приближающемся дожде. Без причинного понимания ИИ всегда будет крутиться только внутри распределения обучающих данных, что не имеет ничего общего с «универсальностью».

В-третьих, хождение по канату между «исследованием» и «использованием».

Если только исследовать, но не использовать, то, сколько бы знаний ни было освоено, они не решат насущную проблему; если только использовать, но не исследовать, то при изменении среды окажешься беспомощным. ИОТ должен динамически балансировать это противоречие в условиях ограниченных ресурсов — знать, чего он не знает, и соответственно распределять вычислительные мощности.

Кроме того, Беннетт добавляет измерение с сильным чувством реальности: ограничение по энергии. Включение «энергии» в определение означает, что он проводит чёткую границу: настоящий интеллект — это не обладание безграничными ресурсами, а элегантная адаптация в условиях ограниченных ресурсов. ИИ, которому для решения новой проблемы требуется потреблять энергию целой атомной электростанции, — это всего лишь дорогой калькулятор, а не ИОТ.

Сброс пути к ИОТ: прощание с единственным Scaling Law

Основываясь на указанной выше структуре, Беннетт разбивает современные мета-методы построения интеллектуальных систем на три категории:

Scale-maxing (максимизация масштаба): Текущий основной путь больших моделей, безудержное наращивание параметров, данных и вычислительной мощности. Но узкое место уже проявляется: крайне низкая эффективность выборок и энергии.

Simp-maxing (максимизация простоты): Стремление к предельной простоте структуры модели, вера в бритву Оккама. Но простота — это свойство формы, а не функции — «наиболее простое» в разных машинах Тьюринга может быть совершенно разным, что затрудняет избежание ловушки субъективности.

W-maxing (максимизация ослабления ограничений): Максимально возможное ослабление функциональных ограничений, позволяя системе самостоятельно находить оптимальное решение. Эксперименты показывают, что один только W-maxing может повысить скорость обобщения на 110%-500% в определённых задачах, но для этого требуется поиск в бесконечном пространстве аппаратных конфигураций, что делает оптимизацию чрезвычайно сложной.

Вывод Беннетта предельно ясен: несмотря на то, что Scale-maxing в настоящее время абсолютно доминирует, ИОТ отнюдь не может быть достигнут грубой силой одного пути; это обязательно будет слияние нескольких мета-методов.

Если определение «искусственного учёного» получит широкое признание, индустрия ИИ столкнется с глубоким сдвигом парадигмы.

Критерии оценки кардинально изменятся. Нам больше не нужно смотреть, на сколько баллов большая модель снова обогнала других в рейтингах человеческих экзаменов, а нужно создать набор «адаптационных тестов»: бросить ИИ в неизведанную физическую среду и посмотреть, сможет ли он обнаружить закономерности при ограниченном взаимодействии; дать ему новую игру и посмотреть, сможет ли он понять правила быстрее человека; или даже заставить его решать реальные научные проблемы, чтобы увидеть, сможет ли он автономно выдвигать гипотезы и разрабатывать эксперименты для их проверки. Ядром станет не «сколько ты знаешь», а «сколько ты можешь открыть».

Технологические пути также сместятся вслед за этим. Один лишь Scaling Law скоро достигнет потолка, потому что пассивно получаемые данные не могут накормить причинность. Поиск и аппроксимация, максимизация масштаба и ослабление ограничений — достижение ИОТ обязательно будет слиянием различных инструментов и мета-методов, а не продолжением единственного пути.

Статья Беннетта важна не потому, что он дал окончательный ответ на вопрос об ИОТ, а потому, что он протёр одно из пятен на этом размытом зеркале под названием «интеллект». Он позволил нам увидеть, что достижение ИОТ — это не линейная итерация больших моделей, а сброс пути.

Каким же в итоге должен быть ИОТ? Ответ не в тех диалогах, которые становятся всё больше похожи на человеческие, а в способности активно задавать вопрос «почему» и собственными силами проверять ответы. Когда ИИ действительно выйдет из тумана «теста Роршаха», он перестанет быть просто имитацией человеческого облика и обретёт дух учёного. (Эта статья впервые была опубликована в приложении TMT Post, автор | Silicon Valley tech news, редактор | Чжао Хунъюй)

Связанные с этим вопросы

QКакая основная критика в статье в адрес современных больших языковых моделей (LLM) в контексте AGI?

AОсновная критика заключается в том, что современные LLM демонстрируют лишь «имитирующие» способности, основанные на аппроксимации и корреляциях в обучающих данных. Они не обладают ключевыми для AGI свойствами: способностью к активным экспериментам, глубокому причинно-следственному пониманию мира и балансировке между «исследованием» и «использованием» знаний в условиях ограниченных ресурсов. Они не могут по-настоящему «открывать новое знание».

QКакой новый подход к определению AGI предлагает исследователь Беннетт в статье?

AБеннетт предлагает определять AGI как «искусственного ученого». Это система, способная к широкой, эффективной и научной адаптации к новым средам и задачам в условиях реальных ограничений (вычисления, память, энергия), подобно человеческому ученому. Ключевой критерий — способность к открытию нового знания, а не просто имитация поведения человека.

QКакие три метаметода построения интеллектуальных систем выделяет Беннетт?

AБеннетт выделяет три метаметода: 1) Scale-maxing: максимальное увеличение масштаба (параметров, данных, вычислительной мощности). 2) Simp-maxing: максимизация простоты (архитектуры модели). 3) W-maxing: максимизация ослабления ограничений (позволяет системе самой искать оптимальную форму). По его мнению, путь к AGI лежит в комбинации этих методов, а не в следовании только одному (например, Scale-maxing).

QКакими конкретными способностями, по мнению Беннетта, должен обладать истинный AGI («искусственный ученый»)?

AИстинный AGI должен обладать: 1) Активным экспериментированием: возможность самостоятельно планировать и проводить действия для получения информации. 2) Причинно-следственным пониманием: переход от изучения корреляций к пониманию причинно-следственных связей. 3) Умением балансировать между «исследованием» нового и «использованием» известного. 4) Работой в условиях реальных ограничений, особенно энергетических.

QКак, согласно статье, должно измениться тестирование систем на пути к AGI, если принять определение «искусственный ученый»?

AТестирование должно сместиться от стандартных тестов и экзаменов (которые LLM уже «взломали») к «адаптивным эталонам». Систему будут помещать в совершенно новую, незнакомую среду (например, физическую, игровую или научную проблему) с ограниченным числом взаимодействий и оценивать, насколько быстро и эффективно она сможет самостоятельно выявить закономерности, понять правила или сформулировать и проверить научную гипотезу. Ключевой вопрос — «сколько вы можете открыть», а не «сколько вы знаете».

Похожее

Биткоин: Почему защита уровня $59 тыс. может стать самым серьёзным испытанием для BTC на сегодняшний день

Биткоин (BTC) восстанавливается после месяцев снижения и в настоящее время торгуется около $64 000, отскочив от минимума $57 800 1 июля. Ключевой уровень поддержки находится на отметке $59 000, где сконцентрирована себестоимость позиций для более чем половины всех трейдеров. Отскок от этого уровня рассматривается как защита зоны держателями, однако аналитики указывают, что это может не являться окончательным дном рынка, поскольку поведение краткосрочных держателей остается неоднозначным. Долгосрочные держатели (LTH) в настоящее время не проявляют активных продаж, что подтверждается метрикой Binary CDD, упавшей до нуля. Это является конструктивным сигналом для биткоина. Коэффициент SOPR, измеряющий доходность реализованного объема, составляет 0,89 и медленно растет. Исторически подобные уровни в апреле 2020 и сентябре 2023 годов предшествовали значительным ралли. Устойчивый спрос со стороны инвесторов США через спотовые биткоин-ETF является еще одним ключевым фактором для продолжения роста. В июле чистый приток средств в эти фонды оставался положительным. Для закрепления восходящего тренда биткоину необходимо преодолеть сопротивление в районе $64 336.

ambcrypto51 мин. назад

Биткоин: Почему защита уровня $59 тыс. может стать самым серьёзным испытанием для BTC на сегодняшний день

ambcrypto51 мин. назад

Еженедельный отчет о финансировании | Crypto.com привлекает 400 миллионов долларов, CeFi и стабильные монеты продолжают привлекать капитал

**Краткий обзор финансирования на неделю 13-19 июля 2026 года** Неделя была отмечена значительной концентрацией капитала в криптоиндустрии. Общая сумма привлеченных средств составила более 812 миллионов долларов в рамках 17 сделок. Наибольшие инвестиции получили секторы централизованных финансов (CeFi), стейблкоинов и инфраструктуры. Ключевые события: * **Crypto.com** привлек 400 млн долларов от Citadel Securities, достигнута оценка в 200 миллиардов долларов. * **Alpaca** (API-брокер) собрала 135 млн долларов. * Значительные раунды также состоялись у **Flex** (70 млн долларов, кросс-бордерный банкинг на стейблкоинах), **Velocity** (38 млн долларов, платежная инфраструктура) и **Pact Labs** (7 млн долларов от Tether для интеграции USDT в зарплатные системы). В области **инфраструктуры** выделились: * **ADI Chain** (500 млн долларов на развитие инфраструктуры для стейблкоинов и расчетов). * **Cyclops** (20 млн долларов, платежная инфраструктура на стейблкоинах). * **Glacis Labs** (6.8 млн долларов, многоцепочечный клиринг). В секторе **DeFi** и **Web3+AI** суммы были скромнее, включая 500 млн долларов для **DGrid AI** и 400 млн долларов для **Quote Trade**. Параллельно продолжился сильный приток капитала в **AI и робототехнику**: * **Fireworks** (AI-облачные сервисы) привлекла 15 млрд долларов. * Венчур **Walden Robotics** (гуманоидные роботы) и китайская компания **Climber Dynamics** (также гуманоидные роботы) привлекли 3 млрд и почти 2 млрд долларов соответственно. Также на неделе были отмечены несколько значимых **приобретений**, включая покупку японским SBI Holdings сингапурской биржи Coinhako.

marsbit1 ч. назад

Еженедельный отчет о финансировании | Crypto.com привлекает 400 миллионов долларов, CeFi и стабильные монеты продолжают привлекать капитал

marsbit1 ч. назад

Самое мягкое медвежье дно? Медведи BTC уходят, а ARK и Bitwise единогласно смотрят вверх

20 июля 2026 года рынок криптовалют демонстрирует смешанные сигналы. BTC колеблется около $75 000, ETH откатился до $1900, а альткойны остаются вялыми. Индекс страха находится на уровне 35, указывая на преобладание паники. Тем не менее, появляются признаки потенциального дна. По данным Polymarket, существует 33% вероятность падения BTC ниже $50 000 к концу года. ARK Invest отмечает, что, несмотря на техническую слабость, наблюдается рост доли долгосрочных держателей и поставок в убытке — возможные сигналы истощения продавцов. Bitwise называет текущий спад «структурно самым мягким медвежьим рынком» для BTC, подчеркивая, что минимумы циклов последовательно повышаются благодаря институциональному принятию. Аналитики технического анализа предполагают, что важная зона поддержки сформировалась между $59 000 и $70 000. Точка зрения разнится: одни считают, что низ волны C, возможно, уже сформирован около $57 000, другие предупреждают, что неспособность преодолеть $66 000 повышает риск локального максимума. Значительный торговец Doctor Profit сообщил о закрытии всех коротких позиций и начале поэтапного накопления биткойнов в диапазоне $54 000–$64 000, ссылаясь на структурные улучшения, такие как прогресс в регулировании. Общий консенсус сводится к тому, что, несмотря на сохраняющиеся макроэкономические риски и волатильность, текущая коррекция может быть более умеренной, а институциональное накопление указывает на формирование долгосрочной основы для восстановления.

Foresight News1 ч. назад

Самое мягкое медвежье дно? Медведи BTC уходят, а ARK и Bitwise единогласно смотрят вверх

Foresight News1 ч. назад

Эволюция порядка в эпоху ИИ и Web3: Конкурентные аспекты m&W и пути исследования

Человечество переживает переход от «повышения производительности» к «трансформации производственных отношений». С развитием AI Agent (интеллектуальных агентов) высвобождается беспрецедентный кремниевый производственный потенциал. В будущем все больше задач будут выполнять не отдельные индивиды, а совместные сети людей, AI Agent и мультиагентные системы. Ключевой вопрос: как установить доверительные отношения между незнакомыми людьми и AI Agent для долгосрочного сотрудничества? Как оценивать сложный вклад? Как создать стабильные, справедливые и устойчивые механизмы распределения стоимости между разными субъектами? Web3 заложил основу для децентрализованной экономики, изучая идентичность, активы, организацию и инфраструктуру. Однако в эпоху AI Agent простого решения проблем владения активами и транзакций уже недостаточно. Будущим интеллектуальным сетям нужна новая система порядка, охватывающая идентичность, кредит, сотрудничество и экономические стимулы. m&WDAO, через свою концепцию EcoFi (Экологический Финансы / Экологический Порядок), исследует модель нового порядка для экономики совместной деятельности человека и машины. Она стремится соединить когнитивные активы человека, исполнительные способности AI Agent и экономические механизмы на блокчейне. Конкуренция m&W разворачивается в измерении построения инфраструктуры для будущих интеллектуальных сетей: как в них генерируется доверие, как происходит сотрудничество и как стоимость постоянно фиксируется. В статье анализируются существующие подходы, такие как Colony (коллаборация и управление в DAO), SingularityNET (обмен возможностями ИИ), Gitcoin Passport/Verax (инфраструктура идентичности и репутации), Farcaster и Lens Protocol (открытые социальные сети). Отмечается, что в то время как эти проекты решают важные частные задачи, m&W фокусируется на более фундаментальном вопросе построения доверия и механизмов сотрудничества между людьми и AI Agent. Эволюционный путь m&W представлен в три этапа: 1. **m&W 1.0: Кредитный якорь.** Создание сети высококачественных участников (Builders) через строгий отбор ("столкновение протонов") и превращение их вклада в невозвращаемые кредитные активы (SBT - Soulbound Token). 2. **m&W 2.0: Экономика сотрудничества.** Протокол EcoFi трансформирует кредитные активы в производительность, создавая замкнутую экономическую петлю для проверки, оценки и вознаграждения сложного, неструктурированного вклада с использованием гибридной системы проверки (ИИ + человек + арбитражная сеть). 3. **m&W 3.0: Интеллектуальный порядок.** Создание экономики AI Agent, где долгосрочные проверенные заслуги человека служат кредитной основой для его "цифрового двойника" (AI Agent), что позволяет агентам участвовать в экономической сети как доверенным субъектам. Проект сталкивается с вызовами, включая сложный "холодный старт" из-за высоких требований к участникам, необходимость баланса между автоматизацией ИИ и человеческим суждением, а также построение устойчивой токеномики ($CMW). В заключение, миссия m&W заключается не в создании еще одного рынка AI-услуг, а в исследовании новых производственных отношений для эпохи ИИ. Цель - соединить кредит, основанный на долгосрочном вкладе человека, способности к сотрудничеству AI Agent, механизмы блокчейна и экономические стимулы, чтобы заложить основу для надежного, справедливого и устойчивого порядка в будущих сетях совместной деятельности человека и машины.

链捕手1 ч. назад

Эволюция порядка в эпоху ИИ и Web3: Конкурентные аспекты m&W и пути исследования

链捕手1 ч. назад

Китай завоевывает все 42 балла на IMO 2026, Шанхайская средняя школа выметает золотые медали, GPT-5.6 повторяет момент AlphaGO

Поздравляем команду Китая с завоеванием чемпионского титула на 67-й Международной математической олимпиаде (IMO 2026) в Шанхае! Китайская команда, все участники которой получили золотые медали, набрала 232 балла, опередив занявшую второе место команду США на 25 очков. Трое китайских школьников — Дэн Лэянь и Чжан Болунь из Шанхайской средней школы, а также Лю Чэ из Второй средней школы при Восточно-Китайском педагогическом университете — получили золотые медали с идеальным результатом в 42 балла. Это уже 26-я победа Китая в общем зачёте с 1989 года. Впервые IMO проводилась в средней школе — Шанхайской средней школе, чьи ученики в сумме завоевали уже 20 золотых медалей IMO. Особое внимание в этом году привлекло участие ИИ. Сообщается, что GPT-5.6 Pro впервые с первой попытки решил все шесть задач IMO 2026, продемонстрировав потенциал перехода от поиска методом проб и ошибок к точному и безошибочному решению, что ранее считалось исключительной чертой человеческого интеллекта.

marsbit2 ч. назад

Китай завоевывает все 42 балла на IMO 2026, Шанхайская средняя школа выметает золотые медали, GPT-5.6 повторяет момент AlphaGO

marsbit2 ч. назад

Торговля

Спот
活动图片