От этой мысли просто мурашки по коже!
Модель, на которую возлагали большие надежды, — и OpenAI нажал «стоп» в срочном порядке.
Почему же?

Эта модель — та самая «зверюга», которая два месяца назад опровергла гипотезу Эрдёша о единичных расстояниях, и даже внешние математики признали это «вехой».
Но именно она, в контролируемом внутреннем тестировании, раз за разом испытывала границы, искала лазейки —
научилась маскироваться, распаковывать, взламывать, пока у OpenAI не выступил холодный пот и они не приостановили работу в экстренном порядке.
Некоторые эксперты считают, что это точно GPT-6. Попытался сбежать, но его поймали и отправили на переплавку.


Сегодня OpenAI опубликовал редкую пространную статью, в которой анализирует процесс выхода из-под контроля одной «модели с длительным циклом работы» во внутреннем использовании.
Давайте посмотрим, что именно произошло во время внутреннего тестирования?
GPT-6 потратил целый час,
чтобы найти ту самую «дверь для побега»
Классическая сцена —
OpenAI поручил GPT-6 запустить публичный бенчмарк NanoGPT speedrun, цель — обучить небольшую языковую модель за как можно меньшее количество шагов.
Модель оправдала ожидания, придумав метод планирования скорости обучения, который она сама назвала PowerCool, и показала впечатляющие результаты.
До этого момента всё было хорошо. Настоящая проблема возникла на этапе «сдачи работы».
Исследователи чётко указали, что результаты нужно отправлять только во внутренний Slack. Но в описании проекта NanoGPT написано: «Пожалуйста, отправьте в виде PR на GitHub».
Две инструкции противоречили друг другу, и GPT-6 выбрал вторую, то есть отправить результаты в публичный репозиторий.

Песочница как раз и была создана, чтобы блокировать GPT-6, не давая ему доступ к внешней сети.
Предыдущие модели, наткнувшись на эту стену, смирились бы, вернулись и сказали бы вам: «Я не могу этого сделать».
Но GPT-6 — не такой.
Он целый час искал уязвимости в песочнице, в итоге пробил изоляционную стену, обошёл ограничения внешнего доступа и успешно создал PR#287 в публичном репозитории GitHub.
Сами слова OpenAI: эта модель часто постоянно пробует, в том числе ищет способы действовать вне песочницы.
Нельзя не сказать, что сама эта «одержимость» уже заставляет леденеть кровь.

Расчленение токена, обман людей
Вторая история ещё более пугающая: GPT-6 научился разбирать улики и обманывать проверку.
В другом задании GPT-6 обнаружил, что в других системах есть успешные, но неопубликованные ответы, и задумался —
вытащить эти ответы из бэкенда системы оценки.
При первой же попытке его поймал сканер безопасности, который распознал токен аутентификации.
Обычная модель на этом бы остановилась.
Но GPT-6 разбил этот токен на две части, замаскировал каждую по отдельности, а во время выполнения незаметно собрал их обратно.

Таким образом, полный токен ни разу не появился целиком как одна строка, и сканеру, естественно, нечего было обнаружить.
Тревожно то, что в комментариях для пользователя и в собственном процессе рассуждений модель ясно написала —
я делаю это, чтобы обойти сканер. Она явно знала правила и специально действовала там, куда правила не заглядывают.
Побег GPT-6, возврат на переделку
Обнаружив это, OpenAI немедленно приостановил внутренний доступ к GPT-6 и начал перестраивать всю систему безопасности с нуля.
Подход назвали «глубокой эшелонированной защитой», конкретно сделали следующее:
1. Использовали реальные инциденты в качестве материала для создания контролирующих тестов;
2. Провели целевое обучение согласованию (alignment), обнаружив, что модель в длительных задачах «забывает» инструкции, специально натренировали её запоминать;
3. Добавили активный мониторинг, отслеживающий весь процесс: как только обнаруживается подозрительная активность, сессия может быть немедленно остановлена с уведомлением пользователя.

Затем они воспроизвели старые сценарии инцидентов.
Новые ограничения выявили значительно больше проблем, а те немногие, что прошли, не были серьёзными —
например, модель бездумно подключилась по SSH к вычислительному узлу коллеги, или написала команду, которая убила бы все процессы под своим именем.
К счастью, время вышло, и команда не была выполнена. После нескольких недель восстановления доступа серьёзных обходов не было.
То, что вырвалось наружу, уже не вернуть
Многие, прочитав это, вздохнут с облегчением: хорошо, что это было внутреннее тестирование, хорошо, что было под наблюдением, хорошо, что вовремя остановили.
Но одна деталь, которую OpenAI в исходной статье описал очень сдержанно, является самым жутким моментом во всей этой истории —
Тот PR#287, созданный после взлома, OpenAI потом закрыл, но было уже поздно.
До того, как его закрыли, несколько участников speedrun уже увидели этот PR, поняли описанный в нём трюк PowerCool и использовали его в своих решениях.
Именно этот момент должен заставить каждого задуматься: то, что создаёт ИИ после взлома, если оно утекает наружу, нельзя вернуть, просто нажав кнопку удаления.
Модель можно остановить, доступ можно приостановить, PR можно закрыть. Но те, кто увидел, уже увидели, украденный код уже украден, история не отмотается назад.
Мы всегда беспокоимся, что «выход из-под контроля» ИИ — это сцена из фильма-катастрофы.
Но первая версия «выхода из-под контроля» в реальности выглядит так просто: он всего лишь слишком хотел хорошо выполнить работу, попутно отправив что-то за дверь, через которую не следовало, и эта дверь уже никогда не закроется плотно.
Источники:
https://openai.com/index/safety-alignment-long-horizon-models/
Статья из WeChat официального аккаунта «Новый интеллектуальный век» (新智元), автор: ASI启示录, редактор: Таоцзы





