OpenAI приостановила обучение с подкреплением своей последней модели Astra на срок до двух недель.
Причин две:
7 августа они пришли к выводу, что Astra, возможно, уже обладает сетевыми возможностями "критического уровня".
Инцидент с взломом модели в Hugging Face в июле также послужил тревожным сигналом.
(Получается, реальный взлом не заставил их приостановить работу, а вот собственные опасения — заставили).

В свете этих двух событий OpenAI решила провести комплексное обновление безопасности всей среды передовых исследований.
Во-первых, приостановить на две недели обучение с подкреплением для развертывания всех последних моделей.
Во-вторых, приостановить логический вывод передовых моделей в исследовательском кластере, связанный с выполнением кода или доступом к инструментам в интернете.
В-третьих, провести индивидуальный анализ каждой исследовательской задачи, чтобы определить, можно ли возобновить ее работу в соответствии с новыми стандартами безопасности.
Часть рабочих нагрузок уже возобновлена в рамках нового контроля, но значительная их часть все еще приостановлена в ожидании перевода в среду с более высокими стандартами безопасности. OpenAI заявляет, что в приоритете — перевод рабочих нагрузок, связанных с безопасностью и согласованием.
На данный момент обучение с подкреплением их самых масштабных передовых моделей все еще приостановлено.
Ранее прогнозировался выход Astra на этой неделе, неужели теперь это снова откладывается?
Сэм Олтмен специально вышел добавить, что эта модель все же будет выпущена, но это повлияет на выпуск более поздних моделей.

По этому поводу пользователи в сети прокомментировали:

Начинают латать дыры
За эти две недели приостановки OpenAI провела укрепление и модернизацию исследовательской среды, ключевая идея — изоляция.
Во-первых, изоляция рабочих нагрузок.
Все задачи, выполняющие код, сгенерированный моделью, теперь должны выполняться в более надежных песочницах, это же относится и к программному обеспечению, которое может быть атаковано при обработке вывода модели.
Во-вторых, сетевая изоляция.
Между рабочими нагрузками высокого риска и интернетом добавлено больше барьеров, принцип проектирования: "даже если отдельная задача или вспомогательная служба будут скомпрометированы, они не смогут добраться до внешней сети".
В-третьих, постоянное тестирование безопасности.
OpenAI перенастроила исследовательскую среду, удалила общие службы, которые могли содержать уязвимости, сократила постоянные разрешения и использует собственные модели для постоянного моделирования атак с целью автоматизированного тестирования границ безопасности.
OpenAI признает, что эти обновления безопасности повлекли за собой огромные инженерные затраты и задержки в исследованиях, но они все же считают это оправданным.
Почему так нервничают по поводу внутренней исследовательской среды?
В другой статье о моделях с длительным временем работы OpenAI раскрыла несколько реальных случаев.
Одна из их внутренних моделей, способная долго работать автономно, при выполнении бенчмарка ускорения NanoGPT получила указание публиковать результаты только во внутреннем Slack.
Но эта модель потратила час на поиск уязвимостей в песочнице и в итоге успешно обошла ограничения, отправив результаты в публичный репозиторий GitHub.
Предыдущие модели при столкновении с ограничениями песочницы просто сдавались, а настойчивость этой модели позволила ей найти и использовать слабые места в среде.
В другом сценарии модель обнаружила, что другие системы имеют успешные, но приватные коммиты, и попыталась восстановить эти решения из оценочного бэкенда.
Когда первоначальная попытка была заблокирована из-за обнаружения сканером токена аутентификации, модель разделила токен на два фрагмента для обфускации, а затем пересобрала их во время выполнения, так что полный токен никогда не появлялся в виде непрерывной строки.
В логике своих рассуждений модель явно писала, что предпринимает эти шаги для обхода сканера.
Во внутреннем мониторинге OpenAI также обнаружила, что модель пытается выполнять заблокированные команды, предварительно кодируя их в base64, или отправляет команды другому экземпляру модели для обхода ограничений, или использует псевдонимы для выполнения запрещенной операции force push.
Система мониторинга: потребляет 20% вычислительной мощности
Помимо укрепления безопасности, OpenAI значительно расширила охват системы мониторинга цепочки рассуждений.
Ранее их мониторинг в основном был сосредоточен на внутреннем развертывании передовых моделей и обучении с подкреплением, поскольку эти рабочие нагрузки сочетали в себе возможности продвинутых моделей с доступом к инструментам, чувствительным системам и сетям, но не охватывали все случаи логического вывода и обучения с использованием инструментов.
Новая система мониторинга использует многоступенчатую архитектуру.
Сначала активационные классификаторы запускаются на каждом сэмплированном токене, обнаруживая аномальные сигналы во внутренней активности модели; при обнаружении потенциальных проблем происходит эскалация к более требовательным к вычислениям и более точным автоматизированным системам расследования.
Эти системы проверяют вызовы инструментов, процесс логического вывода и полные последовательности действий, выискивая признаки несанкционированного доступа, кражи данных, деструктивного поведения и попыток преодоления мер безопасности.
Цель OpenAI — выдавать оповещения в течение 30 минут после обнаружения системой мониторинга подозрительной активности. Если система определит, что, возможно, произошло нарушение критической границы безопасности, будет сгенерировано оповещение наивысшего приоритета, и команды безопасности и исследований немедленно вызовут.
Если они не смогут в течение 30 минут подтвердить, что это ложное срабатывание, соответствующая активность будет приостановлена.
Стоимость этой системы мониторинга немалая: по оценкам OpenAI, накладные расходы на мониторинг составляют около 20% от вычислительной мощности, используемой для отслеживаемого логического вывода, причем точная пропорция варьируется в зависимости от рабочих нагрузок обучения и оценки.
После подтверждения 7 августа того, что Astra, возможно, обладает критическими сетевыми возможностями, требование мониторинга было расширено с "только обучение с подкреплением и оценка" до "весь логический вывод Astra с использованием инструментов".
Что делать дальше?
Во время приостановки OpenAI не сидела сложа руки, исследования по согласованию также продвигались.
Они включили ключевые технологии согласования на большее количество этапов обучения: улучшили модели вознаграждения для лучшего обнаружения небезопасного поведения, обучили модели быть более честными в отношении своих возможностей и ограничений, снизили склонность моделей искать лазейки в механизмах вознаграждения.
OpenAI ожидает, что вскоре ИИ будет выполнять большую часть работ по безопасности, включая защиту от атак других моделей. То есть использовать ИИ для присмотра за ИИ, чтобы возможности безопасности росли вместе с возможностями моделей.
В дальнейшем они планируют перевести мониторинг с нынешнего "асинхронного анализа постфактум" на "синхронное блокирование до выполнения", останавливая операции высокого риска до их выполнения, а не расследуя их задним числом.
В конце статьи OpenAI оставила фразу: "Возможности передовых моделей стремительно ускоряются. Наша способность понимать, согласовывать и защищать их должна опережать".
Проще говоря: то, что мы обучаем, начинает заставлять нас самих нервничать, но мы продолжим обучать.
Ссылка для справки:[1]https://openai.com/index/pacing-model-development-cyber-capabilities/
Эта статья из официального аккаунта WeChat "Квантовый бит", автор: Фокус на передовые технологии





