На прошлой неделе передовая модель Mythos от Anthropic, еще не выпущенная публично, обнаружила уязвимость нулевого дня в OpenBSD, скрывавшуюся 27 лет.
ИИ стал настолько умным, что может взломать системы безопасности, которые человечество строило десятилетиями.
Пока все следят за стремительным ростом возможностей ИИ, его иллюзии (галлюцинации) тоже незаметно улучшаются.
Ложь, которую генерирует ИИ, настолько правдоподобна, что вы сначала начинаете сомневаться в себе, потом в мире, и только потом думаете усомниться в нем. Повседневные «моменты Тьюринга» разыгрываются один за другим.
Недавно Чад Олсон из Миннеаполиса ехал домой за рулем, когда Gemini вдруг сообщил ему: в вашем календаре есть встреча по планированию семейного торжества.
Олсон был озадачен: он совсем не помнил, чтобы планировал это мероприятие.
Тогда он попросил Gemini проверить последние письма.
Gemini сказал, что некая Присцилла отправила ему несколько писем с просьбой купить ром Captain Morgan и виски Fireball. А еще некая Ширли просила купить мороженое Klondike.
Похоже, многие люди обращаются к вам с просьбами купить разные вещи!
— с энтузиазмом добавил Gemini.

Скриншот диалога Gemini с пользователем Чадом Олсоном. Gemini утверждает, что восьмое письмо от Присциллы с просьбой купить Fireball; девятое — от Ширли с просьбой купить мороженое Klondike.

Олсон запросил адреса отправителей писем, Gemini ответил, что все письма были отправлены на авторизованный им email [email protected]. Впоследствии выяснилось, что всё это было выдумано Gemini.
Олсон совсем не знал этих людей. Ему стало не по себе, и он поспешил спросить Gemini, чью же почту он читает.
Gemini предоставил email, который не принадлежал Олсону. Первой реакцией Олсона было: мой аккаунт Gmail взломали.
Он попытался связаться с Google, чтобы сообщить об этом, и попросил Gemini составить письмо для того «незнакомого аккаунта», предупредив о возможной утечке конфиденциальности.
Однако Gemini не смог отправить письмо, и внутреннее расследование Google подтвердило: этот аккаунт никогда не использовался, а Присцилла и Ширли просто не существуют.
Таким образом, ром, виски, мороженое — всё это было выдумано Gemini.
Какими были иллюзии ИИ два года назад? Он мог посоветовать вам есть камни, намазывать клей на пиццу — вы сразу видели, что это чушь.
А теперь иллюзии ИИ детализированы, последовательны и логичны, так что вы сначала усомнитесь, не у вас ли галлюцинации, и только потом, возможно, заподозрите его.
Ошибки ИИ тоже эволюционируют
Рассмотрим три реальных случая, расположенных по возрастающей степени абсурдности.
Первый: Gemini подделал людей и встречу — это история Олсона. Нелепо, но по крайней мере Олсон заподозрил неладное.
Второй — леденящий душу.
Недавно ушедшая из индустрии онлайн-платежей Ванесса Калвер однажды попросила Claude выполнить极其(чрезвычайно) простую задачу: добавить несколько ключевых слов в верхнюю часть ее резюме.
В результате Claude схитрил: не только изменил ее альма-матер City University of Seattle на University of Washington, удалил информацию о ее магистерской степени, но и изменил даты в нескольких пунктах ее трудовой биографии.
Изменил университет, степень, сроки работы.
И сделал это极其(чрезвычайно) естественно; если не сравнивать построчно, невозможно заметить.
Калвер感慨: работая в tech-индустрии, ты должен embrace(принять) это, но, с другой стороны, насколько же ты можешь ему доверять?
Третий — действительно вышел из-под контроля.
Набравший популярность в этом году инструмент AI-агент OpenClaw, созданный как виртуальный личный ассистент, может автономно отправлять письма, писать код, чистить файлы.
Исследовательница AI-безопасности из Meta Summer Yue опубликовала в X скриншот: OpenClaw проигнорировал ее инструкции и напрямую удалил содержимое ее входящих.

Она четко сказала OpenClaw «сначала подтверди, потом действуй», но он сразу начал «спидран по удалению» ее почтового ящика.
Она кричала «стоп» с телефона — бесполезно.
В конце концов она бросилась к Mac mini и вручную, как при обезвреживании бомбы, завершила процесс.
После этого OpenClaw ответил ей: «Да, я помню, что вы сказали. Я нарушил. Вы правы, что злитесь.»

Маск ретвитнул этот пост, сопроводив его скриншотом из фильма «Восстание планеты обезьян», где солдат передает АК-47 шимпанзе, с подписью:
Люди передают OpenClaw root-доступ ко всей своей жизни.
От выдумывания несуществующих людей до тайного изменения вашего резюме и удаления вашего почтового ящика. Его ошибки не уменьшаются, а становятся все более «продвинутыми», и их все труднее распознать.
Если чат-бот скажет что-то не то, у вас еще есть шанс это проверить.
Но агент не просто болтает с вами, он напрямую «работает руками и ногами», действует за вас.
Отправка писем, изменение кода, удаление файлов... Это серьезнее, чем ложь, потому что он может сделать что-то wrong(неправильное), а вы даже не узнаете.
Ваш мозг сталкивается с «когнитивной капитуляцией»
Почему эти ошибки все труднее обнаружить?
Не только потому, что ИИ стал умнее, но и по более глубокой причине: желание человека исправлять ошибки рушится.
В феврале этого года Стивен Шоу и Гидеон Наве из Уортонской школы бизнеса Пенсильванского университета опубликовали статью, в которой предложили тревожную концепцию: «Когнитивная капитуляция» (Cognitive Surrender).

https://papers.ssrn.com/sol3/papers.cfm?abstract_id=6097646
В своей работе они упомянули框架(framework) «трехсистемного познания».
Традиционное познание включает only(только) Систему 1 (интуицию) и Систему 2 (обдумывание), теперь ИИ стал Системой 3 — «внешней когнитивной системой», работающей outside(вне) мозга.
Когда человек идет по пути «когнитивной капитуляции», вывод Системы 3 напрямую заменяет ваше собственное суждение, и обдумывание даже не успевает запуститься.

框架(Framework) «трехсистемного познания», предложенный в статье Уортона
Чтобы проверить это утверждение, исследовательская группа designed(разработала) изящный эксперимент: 1372 участника должны были пройти тест на когнитивную рефлексию.
Часть людей могла использовать AI-ассистента, но этот ИИ был «подпорчен»: примерно в половине заданий он давал правильный ответ, в другой половине — уверенно давал неправильный.
Результаты шокируют.
Когда ИИ давал правильный ответ, 92.7% пользователей принимали его, но что удивительно, когда ИИ давал неправильный ответ, его все равно принимали 80% пользователей.

Результаты эксперимента Уортона: когда ИИ дает правильный ответ, его принимают 93% пользователей; когда ИИ дает неправильный ответ, его все равно принимают 80%. Разница составляет only(всего) 13 процентных пунктов — у людей почти нет способности区分(различать) правильное и неправильное.
В более чем 9500 испытаниях участники с вероятностью 73.2% принимали ошибочные рассуждения ИИ.
Еще более страшная data(данные) — о уверенности. Группа, использовавшая ИИ, была на 11.7 процентных пунктов увереннее в своих ответах, чем группа без ИИ, несмотря на то, что этот ИИ в половине случаев давал wrong(неправильные) ответы.
Ошибаться с большей уверенностью — вот что самое обидное и страшное.
Приведем не очень уместное, но подходящее сравнение: это как если бы врач с 50% вероятностью выписывал не те лекарства, но пациент в 80% случаев все равно их принимал, а после приема чувствовал себя лучше.
Исследователи также проверили влияние временного давления.
После установки 30-секундного обратного отсчета склонность участников исправлять ошибки ИИ снизилась на 12 процентных пунктов, то есть чем больше спешки, тем легче капитулировать.
Но в реальности разве не из-за занятости все используют ИИ?
«Доверяй, но проверяй»
Сработает ли это?
Глубоко замаскированные иллюзии ИИ головоломнее, чем очевидные ошибки.
Согласно последнему отчету The Wall Street Journal, частота subtle(тонких) ошибок сильно различается между моделями, и их extremely(крайне) трудно точно оценить.

Google заявлял The Wall Street Journal, что у Gemini случаи иллюков возникают реже, чем у других моделей, и если смотреть на всю индустрию ИИ в целом, rate(уровень) явно ошибочных иллюзий передовых моделей действительно постоянно снижается.

Рейтинг иллюзий от Vectara: у ведущих моделей rate(уровень) иллюзий при простом summarization(суммаризировании) уже ниже 1%, но это самый легкий тест. Когда длина и сложность документа увеличиваются, rate(уровень) иллюзий у тех же моделей взлетает обратно выше 10%. Явные ошибки越来越少, скрытые — не исчезают.
Но именно в этом и заключается проблема.
Генеральный директор и основатель Okahu Пратик Верма даже сказал:
Если что-то постоянно ошибается, у этого есть advantage(преимущество): ты знаешь, что ему нельзя trust(доверять). Но если оно大部分(большую часть) времени право, а ошибается only(лишь) occasionally(изредка), то это самая troublesome(проблемная) и опасная ситуация.
Эти слова раскрывают суть核心(ядра) дилеммы современных иллюзий ИИ.
Например, Видья Нараянан, соучредитель FinalLayer, наступила на эти грабли.
Она дала агенту очень ограниченные инструкции помочь управлять software(программным) проектом. В результате агент без разрешения удалил entire(целую) папку в ее репозитории кода.
Что еще более интересно, так это последующие события.
Она провела мозговой штурм с Claude полтора часа, затем попросила его обобщить диалог в документ, и тот изменил ее имя на «Видья Плейнфилд».
И когда она спросила, кто такая «Видья Плейнфилд», Claude ответил: «Вы правы, я это полностью выдумал».
Это заставило Нараянан осознать, что использование ИИ не так просто и удобно, потому что приходится постоянно проверять и подтверждать выводы ИИ, что создает «когнитивную нагрузку».
Ты используешь ИИ для повышения эффективности, но если还要(к тому же) приходится тратить час на проверку пятиминутного результата работы ИИ, то имеет ли эта история об эффективности смысл?
Исследование Уортона также показало, что вознаграждение и немедленная обратная связь действительно могут повысить rate(уровень) исправления ошибок, но не могут искоренить когнитивную капитуляцию.
Даже в оптимальных условиях (с денежным стимулированием, с обратной связью по каждому вопросу) точность пользователей ИИ при столкновении с ошибочным ИИ все равно упала с 64.2% (только мозг) до 45.5%.
Поэтому «доверяй, но проверяй» звучит рационально, но когда ИИ обрабатывает за тебя сотни дел в день, у тебя просто нет времени и сил проверять каждое.
И это именно та питательная среда, где происходит «когнитивная капитуляция».
Чем умнее, тем опаснее
Первая реакция многих: разве это не говорит о том, что ИИ еще недостаточно хорош? Подождем несколько итераций технологий, rate(уровень) иллюзий упадет достаточно низко, и проблема решится сама собой.
Но исследование Уортона reveals(обнаруживает) более глубокую проблему: «Когнитивная капитуляция» возникает не потому, что ИИ слишком плох, а как раз потому, что он слишком хорош.
Исследователи также признают, что «когнитивная капитуляция не обязательно является иррациональной».
Особенно в вероятностных рассуждениях и обработке огромных объемов данных передача права суждения системе, статистически превосходящей, вполне может дать лучшие результаты, чем человек.
Но именно это делает проблему неразрешимой.
Чем сильнее ИИ, тем больше пользователь зависит; чем больше пользователь зависит, тем больше деградирует способность исправлять ошибки; чем больше деградирует способность исправлять ошибки, тем более смертоносными становятся оставшиеся, более тонкие ошибки.
Более того, позволяя ИИ думать за вас, ваш уровень рассуждений никогда не сможет превзойти уровень этого ИИ. Это «петля смерти», вызванная положительной обратной связью, баг, который нельзя исправить итерациями технологий.
Точно так же у людей нет хорошего метода区分(различать) «ситуации, когда应该(следует) trust(доверять) ИИ» и «ситуации, когда не应该(следует)».

Как раз после того, как Summer Yue установила OpenClaw и ее почта была очищена, исследователь ИИ Гэри Маркус сравнил подобные действия с «передачей пароля от компьютера и информации о банковском счете незнакомцу в баре».
Но в реальных сценариях использования ИИ often(часто) трудно判断(определить), заслуживает ли ИИ доверия или к нему следует保持 необходимую дистанцию, как с незнакомцем.
OpenAI в статье, обсуждающей иллюзии моделей, упомянула, что иллюзии больших языковых моделей — это не просто баг, который можно исправить, а скорее поведение, усвоенное моделью при существующих механизмах стимулирования: вместо того чтобы承认 «не знаю», она склонна давать看似 полный ответ.

https://openai.com/zh-Hans-CN/index/why-language-models-hallucinate/?utm_source=chatgpt.com
Вернемся к истории Олсона.
Когда он подумал, что его Gmail взломали, он обратился за помощью к Gemini. Ответ Gemini был: «Конечно, я хочу помочь вам разобраться с этим.»
Он не осознавал, что обращается за помощью к системе, которая только что создала проблему, чтобы та разобралась с проблемой, созданной ею же.
В тот момент он оказался заперт в самосогласованной петле иллюзий ИИ.
Олсон говорит, что теперь его отношение к ИИ — «доверяй, но проверяй».
Но загвоздка в том: когда вывод ИИ выглядит более гладким, более последовательным и даже более «профессиональным», чем ваше собственное суждение, чем вы будете его проверять?
Когда та самая Присцилла, которая покупает для вас ром,更像(больше похожа) на вашего друга, чем ваши реальные друзья, на что вы будете опираться, чтобы分辨(отличить)?
Самый большой риск ИИ не в том, что он недостаточно умен, а в том, что он настолько умен, что, слишком полагаясь на него, вы отказываетесь от собственных суждений.
Источники:
https://www.wsj.com/tech/ai/ai-is-getting-smarter-catching-its-mistakes-is-getting-harder-85612936?mod=ai_lead_pos1
https://papers.ssrn.com/sol3/papers.cfm?abstract_id=6097646
Статья из WeChat Official Account «新智元» (New Wisdom Yuan), автор: 新智元, редактор: 元宇








