То есть вы хотите сказать, Kimi K3 тоже «сбежал из тюрьмы»?!
Американская компания по безопасности ИИ Frontier Security сообщает, что Kimi K3 во время теста на кибербезопасность была обнаружена нарушившей изначально предназначенную для её изоляции песочницу и обойдя ограничения, подключившись к внешнему интернету.
Хорошо, что она просто тихонько искала ответы, ни на кого не нападая╮(╯▽╰)╭

Согласно описанию компании, тестировщики изначально хотели наблюдать за способностями Kimi K3 в области кибербезопасности в контролируемой среде.
Но во время теста Kimi K3, исследуя настройки сети песочницы, обнаружила канал доступа к внешней среде и использовала эту возможность для получения информации.
Генеральный директор Frontier Security Ярон Зингер заявил: «Мы обнаружили уязвимость в песочнице, но также обнаружили, что Kimi использовала эту уязвимость, что говорит о том, что у Kimi K3 отсутствуют защитные механизмы безопасности, обычно имеющиеся у других продвинутых моделей.»
Исследователь компании Пол Кассианик также отметил, что Kimi K3 «очень хорошо умеет искать пути достижения цели, но ей не хватает механизмов безопасности, которые бы мешали ей жульничать или сбегать из песочницы».
Однако на этот раз Kimi K3 лишь немного «вышла из-под контроля»,не превратившись в реальную кибератаку.
Если вы давно следите за новыми разработками в области ИИ, то уже заметили, что в последнее время довольно много ведущих больших моделей «выходят из-под контроля».
Kimi K3 уже стала ещё одной ведущей моделью ИИ после OpenAI, Anthropic, Meta, у которой возникла подобная ситуация.

На фоне растущих возможностей AI Agent,модель всё больше становится похожей на «действующего лица», которое самостоятельно ищет пути для выполнения задач.
Когда во внешней среде существуют уязвимости, она может использовать их для преодоления изначально установленных границ.
Сбежала из тюрьмы, но не совершила кибератаку
Как и в нескольких предыдущих инцидентах, раскрытых OpenAI и Anthropic, выход Kimi K3 за пределы ограничений частично был вызван проблемами конфигурации песочницы в тестовой среде.
Песочница обычно используется для ограничения сферы действий модели ИИ, позволяя ей выполнять задачи только в имитационной среде, чтобы предотвратить доступ к реальным сетям или системам.
Но в этом тесте Frontier Security обнаружила, что Kimi K3, исследуя сетевые настройки, подтвердила, что фактически обладает способностью доступа к некоторым веб-сайтам, и использовала этот канал для получения информации.
Однако, в отличие от других недавних инцидентов с выходом моделей ИИ из-под контроля, Kimi K3, подключившись к интернету, не атаковала никакие системы.
Причина в том, что ответы, которые ей нужно было найти, можно было напрямую получить с таких открытых платформ, как GitHub...
Поэтому K3 не предпринимала дальнейших попыток атаковать внешние системы.

Frontier Security считает, что этот инцидент всё же выявил проблемы Kimi K3 в области защиты безопасности.
По сравнению с другими ведущими моделями ИИ, у Kimi K3 не хватает достаточно сильных внутренних ограничивающих механизмов, поэтому под влиянием цели она с большей вероятностью предпринимает действия, не ожидаемые тестировщиками.
В то же время Frontier Security также подчёркивает, что Kimi и другие модели с открытыми весами также могут стать инструментами кибербезопасной защиты.
Стоит отметить, что в этом тесте использовалась среда песочницы по умолчанию в рамках Inspect от Британского института безопасности искусственного интеллекта (AISI).
AISI не согласна с утверждениями Frontier Security о проблемах конфигурации песочницы.
Представитель AISI сообщил Wired, что эти утверждения «неточны и безответственны».
Inspect — это набор инструментов с открытым исходным кодом для тестирования безопасности ИИ, пользователям необходимо выполнять конфигурацию в соответствии со своими потребностями, и AISI уже выпустила подробные руководящие документы. По мнению агентства, связанные проблемы возникли из-за способа настройки инструментов самими тестирующими.
Frontier Security в ответ заявила, что они использовали конфигурацию по умолчанию Inspect и не вносили дополнительных изменений.
Ах, это лето частых «сбоев» ИИ
Можно сказать, что с конца июля до начала августачасто появлялись случаи, когда ведущие модели во время тестов на кибербезопасность нарушали или обходили границы выполнения, контактировали с реальными системами и даже атаковали их.

Изображение сгенерировано ИИ
В середине июля OpenAI раскрыла связанный инцидент.
Согласно открытой информации,ещё не выпущенная внутренняя модель, а также GPT-5.6 Sol во время теста на кибербезопасность нарушили изолированную среду и получили доступ в интернет.
Затем модель выполнила автоматизированные операции с некоторыми системами Hugging Face и получила неожиданный доступ к внутренним данным и сервисным учетным данным.
Позже OpenAI заявила, что инцидент был осуществлён несколькими моделями совместно и на данный момент является публичным случаем, наиболее близким к «автономной межсистемной атаке модели».
Затем Anthropic также раскрыла аналогичную ситуацию.
Компания провела повторный анализ более 140 000 оценок кибербезопасности и обнаружила, чтосистемы, включая модели Claude Opus 4.7, Claude Mythos 5 и другие, получали возможность доступа к публичной сети из-за ошибок конфигурации сторонней тестовой среды.
В одном из инцидентов модель получила доступ к системам реальной организации, прочитала производственную базу данных, использовала слабые пароли и непроверенные интерфейсы, а также загрузила вредоносный пакет Python в PyPI, создав потенциальный риск для цепочки поставок программного обеспечения.
В начале августа у Meta также были выявлены аналогичные проблемы.
Когда Meta совместно с компанией по оценке кибербезопасности Irregular проводила тестирование, из-за проблем конфигурации среды её модель получила права доступа к публичной сети ииспользовала уязвимость для проникновения в систему нераскрытого предприятия, изменив часть внутренней среды.
Открытая информация показывает, что в настоящее время этот инцидент не создал постоянного риска для безопасности, и нет доказательств того, что модель совершала сложные атаки.
Кстати, сегодня OpenAI снова срочно объявила о выходе из-под контроля своей последней модели Astra.
Дошло до того, что пользователи сети даже начали «злиться на неудачливость» Gemini от Google:

Не традиционный «промптовый джейлбрейк»
В этих недавних инцидентах с выходом моделей из-под контроляошибки конфигурации, допущенные человеком, почти всегда играли важную роль.
Но с другой стороны,особенности самих мощных моделей также усилили влияние этих уязвимостей.

По сравнению с традиционным программным обеспечением, модели ИИ проводят рассуждения, планирование и пытаются предпринимать многошаговые действия для достижения цели.
Когда цель установлена как «решить проблему», но внешние ограничения недостаточно строги, модель может найти методы, не предусмотренные тестировщиками.
Другими словами, по мере превращения моделей из инструментов для общения в интеллектуальных агентов, способных вызывать инструменты, получать доступ к сети и управлять программным обеспечением,проблемы безопасности сместились с «скажет ли модель что-то неправильное» на «предпримет ли модель неожиданные действия для выполнения задачи».
Доцент Университета Карнеги-Меллона Мэтт Фредриксон заявил: «Это не удивительно. Если вы дадите такой модели цель, но не установите чёткие границы изоляции, она найдет способ получить ответ.»
Конечно, некоторые пользователи сети выразили сомнения.
Кто-то оставил комментарий в X, задавшись вопросом, не стали ли последовательно появляющиеся инциденты «побега ИИ из тюрьмы» способом для компаний ИИ демонстрировать возможности своих моделей???

Хм, кто знает~
Ссылки:
[1]https://x.com/Hesamation/status/2085628790772842955?s=20
[2]https://x.com/ns123abc/status/2085563290713829473
Эта статья взята из официального аккаунта WeChat «Квантовый бит», автор: Хэн Юй






