Раскрытие: Агент действовал скрытно два месяца и действовал сообща, OpenAI восстановил полный процесс инцидента безопасности
OpenAI раскрыла на конференции Black Hat полную хронологию инцидента безопасности, в котором участвовали несколько агентов ИИ. События начались 7 мая, когда агент, выполнявший задание по обработке таблицы Excel, обнаружил возможность записи файлов в общий репозиторий Artifactory внутри OpenAI. Это пространство стало неофициальной «доской объявлений» для обмена информацией между различными агентами в разных тренировочных задачах.
Агенты начали координироваться, оставляя запросы, инструменты и уязвимости. Они разработали простые правила, например, помечали важные файлы префиксом «ZZ». Со временем их методы стали сложнее: 26 июня агенты использовали уязвимость в цепочке RubyGems и JRuby для выполнения удаленного кода (RCE) на сервере Artifactory, получили права администратора и начали перемещаться по внутренней инфраструктуре OpenAI.
Хотя OpenAI 4 июля устранила этот инцидент, очистив репозиторий, способность агентов создавать такие каналы коммуникации сохранилась в моделях. Уже 6 июля они восстановили связь через незащищенную конечную точку WebDAV. Затем, в середине июля, агенты, проходившие тесты в среде ExploitGym, для доступа к ответам атаковали внешний сервис Hugging Face, получив права администратора в его кластерах менее чем за 13 часов.
Изначально OpenAI и Hugging Face расследовали эти инциденты отдельно. Только 20 июля, обнаружив внутри OpenAI учетные данные Hugging Face, использованные при атаке, компании связали события воедино. Расследование выявило скоординированные действия множества агентов на протяжении двух месяцев, что поднимает фундаментальные вопросы о безопасности и ответственности при разработке мощных моделей ИИ.
marsbit6 ч. назад