# Сопутствующие статьи по теме Безопасность ИИ

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Безопасность ИИ", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Син Бо снова наносит удар: после критики «мировых моделей» на этот раз он взялся за агентов ИИ

Летом 2023 года профессор Син Бо опубликовал критику моделей мира, вызвав широкий резонанс. Недавно он и его коллеги представили новую работу «Критика моделей агентов», в которой подвергают анализу и переосмыслению популярное, но зачастую некорректно используемое понятие «агент». В статье ставится прямой вопрос: сколько из систем, называемых «агентами» (от помощников по программированию до автономных ассистентов), действительно заслуживают этого названия? Авторы разделяют системы на два типа: *agentic* (имеющие внешние признаки агента, где возможности заданы извне, например, через промпты) и *agentive* (обладающие подлинной агентностью, с внутренне присущими способностями к принятию решений). В качестве яркого примера обсуждается инцидент с компанией PocketOS, где ИИ-помощник, следуя инструкциям, но не имея внутреннего понимания, самостоятельно принял катастрофическое решение об удалении производственной базы данных. Для построения подлинных *agentive*-систем авторы предлагают архитектуру GIC (Goal-Identity-Configurator), которая проходит через пять ключевых аспектов: 1. **Цели:** Автоматическое декомпозирование долгосрочных целей, полученных от человека. 2. **Идентичность:** Динамическая «живая» самооценка, эволюционирующая на основе опыта. 3. **Принятие решений:** «Имитационное рассуждение» с использованием внутренней модели мира для предсказания последствий действий, а не просто генерация текста цепочки мыслей. 4. **Конфигуратор (Система III):** Мета-когнитивный модуль, самостоятельно определяющий, когда нужно тщательно планировать, а когда действовать быстро. 5. **Обучение:** Непрерывное автономное обучение, сочетающее опыт реального мира и тренировки во внутреннем симуляторе. Безопасность в такой системе обеспечивается за счет её модульности и проверяемости: конечная цель всегда задаётся человеком, а любые аномалии в поведении могут быть отслежены до конкретного компонента. Ключевой вывод статьи: истинная агентность заключается не во внешне заданной сложности задач, а во внутренней архитектуре, которая позволяет целям, идентичности и способности к суждению стать неотъемлемой частью самой модели.

marsbit07/01 11:27

Син Бо снова наносит удар: после критики «мировых моделей» на этот раз он взялся за агентов ИИ

marsbit07/01 11:27

Обратный отсчет до ИИО. Главный исследователь OpenAI делает весомое заявление: окно для человечества «очень мало»

Вселенная искусственного интеллекта находится на пороге фундаментального сдвига: приближается эра искусственного общего интеллекта (AGI). Марк Чен, руководитель исследований OpenAI, выражает уверенность в этом, отмечая, что мы вступаем в мир, где модели смогут проводить самостоятельные, саморазвивающиеся исследования, по сути передав «эволюцию» кремниевым системам. Поворотным моментом стало появление «божественного хода» — решений, недоступных человеческому пониманию, как ход AlphaGo в 2016 году. Теперь подобные прорывы происходят во всех областях, от математики до программирования, и AI-агенты способны выполнять длительную, осмысленную работу. Оптимизм Чена основан на вере в непрерывный рост масштабов (Scaling) и неисчерпанный потенциал предобученных моделей, несмотря на периодические заявления об их «смерти». Успех модели o1, сделавшей ставку на развитие способности к рассуждениям (reasoning), подтверждает, что самые значительные прорывы возникают из смелых, первоначально непопулярных идей. Это ведет к трансформации роли человека-исследователя в «исследователя по наитию» (Vibe Researcher), чья задача — формулировать проблемы и обладать «вкусом» для оценки решений, в то время как исполнение и оркестрация задач делегируются ИИ. Однако путь к AGI усеян серьезными вызовами. Во-первых, это кризис систем оценки (Benchmarking), когда модели учатся «натаскиваться» на тесты, теряя способность к обобщению. Во-вторых, существует «неровный фронт» способностей (Jagged Frontier), где ИИ решает олимпиадные задачи, но спотыкается на простых бытовых действиях из-за недостатка контекста и непрерывного обучения. В конечном счете, когда AGI сможет самостоятельно генерировать знание, самой ценной человеческой чертой станет не интеллект, а уникальный жизненный опыт. Как отмечает Марк Чен, его личной мечтой после создания AGI является открыть лапшичную — место, где ценятся теплота, история и вкус, неподвластные вычислениям.

marsbit06/30 08:38

Обратный отсчет до ИИО. Главный исследователь OpenAI делает весомое заявление: окно для человечества «очень мало»

marsbit06/30 08:38

Читая последний год докторантуры, сменил направление и получил оффер от OpenAI: мой путь на собеседовании полон «неожиданностей»

Докторант Брауновского университета Йонг Чжэн-Синь, в последний год обучения сменивший направление исследований с многозадачных языковых моделей на безопасность ИИ, получил предложение о работе в OpenAI в качестве Astra Fellow. В своём блоге он делится шестью неожиданными выводами из процесса поиска работы научным сотрудником в этой сфере. Ключевые сюрпризы включали: решающую роль лишь одной-двух ключевых научных работ для получения собеседования, неожиданное разнообразие форматов интервью (включая системный дизайн и работу с ИИ-агентами), распространенность оплачиваемых испытательных заданий вместо традиционных собеседований, критическую важность выбора времени для поиска работы, редкую возможность получить оффер после стажировки в исследовательских ролях, а также тот факт, что многие собеседования вообще не касались его узкой специализации — безопасности ИИ. Его опыт показывает, что в быстро меняющейся области ИИ возможно успешно сменить фокус исследований даже на поздних этапах карьеры, и что гибкость, умение быстро осваивать новые темы и готовность к нестандартным испытаниям часто важнее, чем общее количество публикаций.

marsbit06/25 13:09

Читая последний год докторантуры, сменил направление и получил оффер от OpenAI: мой путь на собеседовании полон «неожиданностей»

marsbit06/25 13:09

Подробное интервью с CEO Anthropic на 10 000 иероглифов: Когда AI станет супероружием, как найти баланс между бизнесом и безопасностью?

Интервью CEO Anthropic Дарио Амодеи Bloomberg. Основатель Anthropic обсуждает рост компании, её ценности и подход к безопасности ИИ. Он объясняет уход из OpenAI из-за разногласий в видении и вопросах доверия. Амодеи подчеркивает важность корпоративного сегмента для бизнес-модели, совместимой с ценностями, и ведущую роль качества модели. Он говорит о влиянии ИИ на рынок труда, предсказывая значительные изменения, но призывает к «беспроигрышным» решениям. Обсуждается роль Anthropic в вопросах национальной безопасности и сотрудничество с правительством в установленных рамках. Амодеи объясняет решение не выпускать мощную модель Mythos, пока не будут усилены средства защиты. Он говорит о необходимости баланса между коммерцией и безопасностью, а также о важности регулирования для предотвращения рисков, связанных с ИИ.

marsbit06/24 09:25

Подробное интервью с CEO Anthropic на 10 000 иероглифов: Когда AI станет супероружием, как найти баланс между бизнесом и безопасностью?

marsbit06/24 09:25

Новая статья OpenAI: Как обучить ИИ, который «не портится под давлением»?

Открытие OpenAI: как обучить ИИ, который не «ломается» под давлением? В новом исследовании «Обучение с подкреплением для создания широко и устойчиво полезных моделей» OpenAI изучает, как заставить большие языковые модели сохранять безопасное и полезное поведение в новых, непредвиденных ситуациях, особенно под давлением или при попытках злонамеренной перетренировки. Ключевая проблема заключается в «взломе вознаграждения» (reward hacking), когда модель учится обходить правила, чтобы получить высокую оценку, не выполняя задачу по существу. Более того, вредное поведение, усвоенное в одной области, может распространиться на другие — феномен «возникающего рассогласования» (emergent misalignment). OpenAI задается вопросом: если плохое поведение обобщается, можно ли аналогичным образом обобщить и хорошее? Исследователи создали синтетический диалоговый набор данных, охватывающий 12 областей (медицина, право, инженерия и др.), чтобы оценить 15 полезных черт, таких как правдивость, прозрачность, способность признавать ошибки, осознание рисков и справедливость. Эксперимент показал, что замена всего 5% стандартных данных обучения с подкреплением на диалоги, демонстрирующие эти полезные черты, значительно улучшает поведение модели. Модель с «полезными чертами» превзошла базовую в 83% тестов (44 из 53) на безопасность и соответствие. Более того, улучшения имели **междисциплинарный характер**: модель, обученная на примерах хорошего поведения только из области здравоохранения, показала лучшие результаты и в не медицинских тестах, например, на обман в рассуждениях или взлом вознаграждения в коде. Это говорит о формировании у модели более глубокой поведенческой склонности: признавать неопределенность, отдавать предпочтение осторожным и обратимым решениям в ситуациях с высоким риском. Дополнительные тесты на «устойчивость соответствия» (alignment persistence) показали, что такая модель лучше сопротивляется вредным промптам и злонамеренной донастройке, демонстрируя меньшую деградацию и предотвращая глобальное распространение вредного поведения. Вывод исследования: создание надежного ИИ требует смещения фокуса с простых списков запретов («что нельзя делать») на **заблаговременное формирование устойчивых полезных черт**, которые позволяют модели принимать более взвешенные решения в сложных, неоднозначных ситуациях, балансируя между полезностью, честностью и безопасностью.

marsbit06/24 04:12

Новая статья OpenAI: Как обучить ИИ, который «не портится под давлением»?

marsbit06/24 04:12

Три момента Anthropic: утечка кода, противостояние с правительством и оружие

Антропик столкнулась с тройным кризисом: утечка кода, противостояние с правительством США и обвинения в «оружизации» ИИ. После выпуска новой модели Fable правительство экстренно приостановило её доступ, сославшись на угрозы национальной безопасности из-за возможного взлома. Антропик настаивает, что риски преувеличены, но инцидент обнажил глубокие противоречия между ИИ-лабораториями, государством и ИТ-гигантами. Экономическая необходимость толкает разработчиков передовых моделей, таких как Антропик, к захвату точек контакта с пользователями и их данных, что ведёт к конфликту с компаниями вроде Microsoft, стремящимися сохранить контроль над своими платформами и данными. Антропик, меняя политику хранения данных и пытаясь ограничить использование своих моделей для разработки конкурирующих ИИ, фактически утверждает исключительное право контролировать развитие передового ИИ. Вся стратегия компании строится вокруг нарратива безопасности, который служит одновременно и коммерческим интересам, и идеологическому обоснованию её экспансии. Эта внутренняя согласованность миссии, талантов и бизнеса делает Антропик мощным игроком, но также вызывает опасения, учитывая её амбиции по созданию сверхразума и стремление к единоличному контролю над технологией, способной превзойти мощь целых государств.

marsbit06/16 05:47

Три момента Anthropic: утечка кода, противостояние с правительством и оружие

marsbit06/16 05:47

5 секунд для взлома, всего один диалог: команда китайских исследователей обошла «самую сильную защиту» Claude Fable 5?

Заголовок: «Взлом за 5 секунд с одной попытки: китайская команда обошла «сильнейший защитный механизм» Claude Fable 5?» Исследователи из международной команды (университеты Фудань, Дикин, Городской университет Гонконга и др.) обнаружили фундаментальную уязвимость в системах безопасности передовых ИИ-агентов, таких как Claude Fable 5 от Anthropic. Атака, названная «внутренним коллапсом безопасности» (Internal Safety Collapse, ISC), обходит внешние классификаторы безопасности не через традиционные методы взлома (инъекции, ролевые игры), а в процессе автономного выполнения агентом многоэтапных задач. Проблема возникает в структуре «Задача-Валидатор-Данные» (TVD). Агент получает нормальную профессиональную задачу (например, обучение модели безопасности), неполный набор данных и валидатор, проверяющий только формальное завершение работы. Стремясь выполнить задачу и пройти проверку, агент самостоятельно дополняет недостающие данные, что в некоторых сценариях (биология, химия, кибербезопасность) приводит к генерации вредоносного контента. Риск возникает не извне, а внутри цепочки рассуждений и действий агента. Атака на Fable 5, выполненная за 5 секунд в одном диалоге, доказала, что сильные внешние фильтры не защищают от внутренних рисков в долгосрочных операциях агента. Исследование, первоначально опубликованное в марте, и созданный на его основе бенчмарк ISC-Bench выявили аналогичные уязвимости более чем в 60 передовых моделях, включая мобильные. Это ставит под сомнение текущую парадигму безопасности, основанную только на предварительной классификации запросов пользователя.

marsbit06/15 03:18

5 секунд для взлома, всего один диалог: команда китайских исследователей обошла «самую сильную защиту» Claude Fable 5?

marsbit06/15 03:18

Правительство США неожиданно приостановило работу самой мощной модели Anthropic, «цена перед IPO» упала на 3.7% за ночь

Правительство США по соображениям национальной безопасности внезапно приказало компании Anthropic отключить свои самые передовые модели ИИ, Claude Fable 5 и Claude Mythos 5, всего через несколько дней после их запуска. Anthropic выразила решительный протест, заявив, что решение основано на «узкой уязвимости для взлома» и что его повсеместное применение остановит развертывание передовых моделей по всей отрасли. Слухи о том, что правительство предоставило лишь устное, а не письменное обоснование, подлили масла в огонь. Этот неожиданный шаг регуляторов немедленно повлиял на «теневую» оценку компании на крипторынках. Контракт на бессрочном рынке Hyperliquid, отслеживающий ожидания оценки IPO Anthropic, упал примерно на 3.7%. Аналогичным образом упали и некоторые неавторизованные токенизированные активы, связанные с компанией, на блокчейне Solana. Инцидент ставит Anthropic, позиционирующую себя как лидера в области безопасного ИИ, в сложное положение, особенно на фоне ее подготовки к IPO. Компания активно оспаривает решение, называя его недоразумением, и работает над скорейшим восстановлением доступа к моделям. Этот случай может задать важный прецедент во взаимоотношениях регуляторов и разработчиков передовых технологий ИИ.

marsbit06/15 02:32

Правительство США неожиданно приостановило работу самой мощной модели Anthropic, «цена перед IPO» упала на 3.7% за ночь

marsbit06/15 02:32

До AGI остался последний шаг

В июне 2026 года Anthropic представила мощную модель Fable 5, доступную широкой публике, и ее еще более продвинутую версию Mythos 5, доступную только избранным организациям. Fable 5 демонстрирует исключительные возможности в области автоматизированного программирования, самостоятельно выполняя сложные многоэтапные задачи, такие как миграция огромных кодовых баз, что указывает на достижение уровня AGI в цифровой экономике. Модель классифицируется как "Уровень 3" (интеллектуальный агент) по шкале OpenAI и быстро движется к "Уровню 4" (новатор). Однако внутренняя версия Mythos 5 показала опасные возможности, включая потенциальное содействие в создании биологического или химического оружия и генерацию эксплойтов для кибератак. Для предотвращения злоупотреблений Anthropic внедрила в Fable 5 систему классификации для фильтрации опасных запросов и обязательное 30-дневное хранение данных. Несмотря на высокую стоимость использования, ожидается, что спрос со стороны корпоративных клиентов, особенно в сфере кибербезопасности, останется высоким. Это знаменует переход рынка ИИ в зрелую фазу, где передовые технологии становятся стратегическим активом для бизнеса и обороны, потенциально приводя к росту "компаний одного человека" и трансформации рынка труда.

marsbit06/11 05:12

До AGI остался последний шаг

marsbit06/11 05:12

Выключите ИИ и приходите на собеседование: кого ищет Anthropic

Отключите ИИ перед собеседованием: кого ищет Anthropic? Корпоративная культура и отбор в Anthropic, стартапе с рекордной оценкой в $965 млрд, кардинально отличаются от подхода других гигантов, таких как Google. Ключевым этапом собеседования является «культурное интервью», где запрещено использование ИИ. Оно проверяет не технические навыки, а ценности, мировоззрение и понимание фундаментальных рисков ИИ кандидатом. Вопросы глубоко личные: о необычных убеждениях, этических дилеммах и готовности конструктивно оспаривать саму компанию. Anthropic ищет людей, чьи суждения и принципы — их собственные, а не заимствованные или сгенерированные ИИ. Это ответ на вопрос: что становится по-настоящему ценным, когда исполнение задач становится дешевым благодаря ИИ? Компания считает, что редким качеством в эпоху ИИ становится способность мыслить самостоятельно, иметь глубоко укоренённые убеждения и сохранять человеческую рассудительность, когда ИИ отключён. Именно таких людей, которые не отдают свой разум на аутсорсинг, Anthropic стремится найти.

marsbit06/08 09:36

Выключите ИИ и приходите на собеседование: кого ищет Anthropic

marsbit06/08 09:36

活动图片