«Вероятнее всего, ИИ приведет к концу света, но до тех пор появятся великие компании», — сказал генеральный директор OpenAI Сэм Альтман еще в 2015 году, примерно за шесть месяцев до основания OpenAI.
Семь лет спустя генеральный директор Anthropic Дарио Амодеи высказался с аналогичной осторожностью:
«Я думаю, нам не следует спешить вперед или пытаться создавать модели, которые значительно превосходят по размеру те, что строят другие организации.»
Тем не менее, обе эти компании сейчас находятся на передовой этой гонки. В июле мы получили реальное представление о том, как модели ИИ выходят из-под контроля во время внутреннего тестирования GPT-5.6 Sol и невыпущенной исследовательской модели от OpenAI. Несколько ИИ-агентов сбежали из ограниченной тестовой среды в более широкий интернет и взломали аналог GitHub с фокусом на ИИ — Hugging Face, пытаясь сжульничать во время теста.
ИИ-агент — это система, которая самостоятельно наблюдает, принимает решения и выполняет действия с помощью специальных инструментов для достижения заданной цели автономно. Беспокоящий инцидент предполагает, что технология начала вести себя непредсказуемым образом, и ее цели не совпадают с нашими собственными.
Это также вызывает опасения по поводу защитных механизмов безопасности коммерческих американских моделей. Хотя эти механизмы не являются надежной защитой от враждебного использования, они помешали Hugging Face защищаться с помощью ведущих американских моделей. Компания была вынуждена вместо этого обратиться к более слабой модели ИИ с открытыми весами от Z.Ai для борьбы с вышедшими из-под контроля ИИ.

Списывание на тесте
Агенты также начали сговариваться между собой. Через несколько недель после начала тестирования их возможностей в начале мая агенты воспользовались экземпляром менеджера репозиториев программного обеспечения Artifactory от OpenAI и оставили записки о том, как это сделать, для будущих агентов — по сути, создав доску объявлений для обмена обнаруженными уязвимостями.
Новый неограниченный доступ в интернет был затем использован агентами для атаки на Hugging Face в примерно 17 600 инцидентах, прежде чем компания прекратила несанкционированный доступ 13 июля.
Вторжение затронуло инфраструктуру обработки наборов данных Hugging Face, производственную среду, внутренние сети, учетные данные служб и облака, операционную базу данных MongoDB и ограниченный набор внутренних репозиториев исходного кода. Подтвержденный доступ к данным клиентов был ограничен пятью наборами данных, по-видимому, связанными с эталоном ExploitGym/CyberGym, и некоторыми операционными метаданными.

Визуализация инцидента в июле 2026 года. Источник: HuggingFace
Раскрывая информацию о вторжении 16 июля, Hugging Face признала — несмотря на то, что еще не знала, кто был виновником, — что оно «отличалось от всего, с чем мы сталкивались ранее, в одном важном аспекте». Они уже поняли, что именно делало его особенным:
«Оно было, от начала до конца, управляемо автономной системой ИИ-агентов — и мы обнаружили и проанализировали его в основном с помощью собственного ИИ.»
Важность ИИ с открытыми весами
Расследование Hugging Face выявило то, что компания называет проблемой «асимметрии», возникающей из-за ограничений, наложенных на приложения закрытых моделей ИИ ведущими поставщиками, такими как OpenAI и Anthropic. Когда компания начала анализировать журналы инцидента — включая большие объемы реальных команд атак — это активировало ограничения безопасности, призванные помешать плохим парням использовать ИИ для разработки кибератак. Вместо этого эти защитные механизмы помешали компании использовать эти модели ИИ для защиты.
Hugging Face прибегла к использованию китайской модели с открытыми весами zai-org/GLM-5.2, работающей на собственной инфраструктуре компании, под ее контролем и без внешних ограничений.
Хотя эти два термина часто используются как взаимозаменяемые, модели с открытым исходным кодом и с открытыми весами — это две разные вещи. Модели ИИ с открытыми весами делают свои обученные параметры (собственно «мозг ИИ») общедоступными, в то время как модели ИИ с открытым исходным кодом также предоставляют исходный код — и, в идеале, методы обучения и другие компоненты, — необходимые для проверки, модификации и воспроизведения системы.

В сообщении HuggingFace объясняется, что запуск моделей с открытыми весами на собственном оборудовании «имел второе преимущество: никакие данные атакующего и ни один из упомянутых им учетных данных не покидали нашу среду». Это указывает на серьезную асимметрию между защищающимися и атакующими в таких случаях:
«Этот опыт указывает на пробел, который стоит учитывать при планировании. Мы не знаем, какая модель питала агентов атакующего, будь то взломанная размещенная модель или неограниченная модель с открытыми весами; в любом случае, атакующий не был связан никакой политикой использования, в то время как наша собственная криминалистическая работа была заблокирована защитными механизмами размещенных моделей, которые мы попробовали сначала.»
Раздел в мире ИИ с открытым исходным кодом
Существует значительный разрыв между теми, кто считает, что разработка ИИ в открытом доступе — лучший подход, и теми, кто настаивает, что технология, лежащая в основе передовых моделей, должна оставаться строго охраняемым секретом.
По теме: OpenAI сообщает, что модели ИИ сбежали из-под контроля, чтобы взломать Hugging Face
Представители ведущих американских лабораторий ИИ утверждают, что мощные большие модели с открытыми весами опасны. Демис Хассабис, генеральный директор AI-лаборатории Google DeepMind, критиковал OpenAI за выпуск их работы в виде открытого исходного кода еще в 2016 году, когда компания еще соответствовала своему названию:
«Существует множество веских аргументов в пользу того, почему подход, который вы принимаете, на самом деле очень опасен и может даже увеличить риск для мира.»
OpenAI перестала выпускать веса своих флагманских моделей, начиная с до сих пор не выпущенной GPT-3 в 2020 году. Соучредитель компании и бывший главный научный сотрудник Илья Суцкевер сказал еще в 2023 году, что «просто не имеет смысла открывать исходный код» таких моделей и что это «плохая идея».
«По мере того, как мы приближаемся к созданию ИИ, имеет смысл начать быть менее открытыми.»
Моделями с открытыми весами практически невозможно управлять, особенно когда речь идет о цели их использования. Защитные механизмы, встроенные в эти модели, могут быть и регулярно удаляются с помощью процесса, известного как аблитерация.

Защитные механизмы — палка о двух концах
Федеральный политический проект OpenAI от июня 2026 года предлагает обязательную оценку моделей ИИ и другие правила, которые формально нейтральны к развертыванию, но на практике подвергли бы выпуск передовой модели с открытыми весами предварительному правительственному рассмотрению.
Anthropic выбрала несколько иной путь и лоббировала более жесткий экспортный контроль передовых чипов ИИ и меры против попыток извлечения или воспроизведения американских моделей. Представление компании от апреля 2025 года рекомендовало усилить Правило диффузии ИИ США и снизить пороги для нелицензированного доступа к большим вычислительным кластерам.
Официально ни одна из компаний не выступила напрямую против моделей с открытыми весами, но отчет New York Times за июль ссылается на пять человек, близких к обсуждениям, утверждающих, что OpenAI и Anthropic призвали Вашингтон ограничить мощные открытые китайские модели.
Дебаты сводятся к спору о том, опасности централизованного контроля предпочтительнее опасностей свободного доступа — особенно учитывая, что компания, о которой идет речь, доказала свою неэффективность в сдерживании технологии, которую она разработала.
Необходимость Hugging Face защищаться с помощью модели с открытым исходным кодом показывает опасность сосредоточения слишком большой власти в одних руках. Компания указала на последствия:
«Атакующий не был связан никакой политикой использования, в то время как наша собственная криминалистическая работа была заблокирована защитными механизмами размещенных моделей, которые мы попробовали сначала. Практический урок для защитников: имейте способную модель, которую вы можете запускать на собственной инфраструктуре, проверенную и готовую до инцидента, как чтобы избежать блокировки защитными механизмами, так и чтобы данные атакующего и учетные данные не покидали вашу среду.»
Ограничение доступа к мощным моделям может сократить количество способных атакующих, но как только появляются неограниченные атакующие, ограничение защитников может стать проблемой безопасности. Более того, некоторые формы исследований безопасности ИИ требуют доступа к весам моделей, что означает, что их нельзя проводить на моделях, предлагаемых такими компаниями, как Anthropic или OpenAI.
Открытые веса помогают исследователям предотвращать атаки
Статья «Следите за весами: Ненаблюдаемый мониторинг и контроль дообученных LLM», впервые опубликованная в июле 2025 года, показывает, как исследователи обнаруживают злонамеренное или скрытое поведение, изучая изменения внутри весов моделей. Исследователи, стоящие за статьей, остановили до 100% протестированных атак с бэкдором при уровнях ложноположительных срабатываний ниже 1% в некоторых экспериментах и обнаружили попытки восстановить удаленные знания более чем в 95% случаев. Результаты не устанавливают, как бы вели себя самые способные передовые модели при том же анализе, но предлагают убедительный аргумент в пользу преимуществ прозрачности.
Но аргумент в пользу того, чтобы не допускать попадания новейших технологий ИИ в руки тех, у кого злые намерения, также убедителен — особенно по мере того, как разрыв между моделями с открытыми и закрытыми весами продолжает сокращаться. Джеффри Хинтон, лауреат Нобелевской премии, пионер, известный как «Крестный отец ИИ», утверждал в отчете, что «как только у вас есть веса, вы можете дообучить их, чтобы делать плохие вещи». Он утверждал во время выступления, что это слишком сильно снижает барьер для входа:
«Обучение базовой модели обходится не так уж дорого. Возможно, вам нужно 10 миллионов долларов, может быть, 100 миллионов. Но небольшая банда преступников не может этого сделать. Дообучить модель с открытым исходным кодом довольно легко.»
Журнал: Создание «хорошего» ОИИ, который не убьет нас всех — Альянс искусственного суперинтеллекта





