OpenClaw стал вирусным, выявив 12 категорий смертельных угроз: выпущен эталон безопасности протокола MCP

marsbitОпубликовано 2026-04-16Обновлено 2026-04-16

Введение

🔥 OpenClaw и другие проекты AI Agent набирают популярность, но их зависимость от протокола MCP (Model Context Protocol) открывает критические уязвимости. Исследование Пекинского университета почты и телекоммуникаций выявило 12 типов атак, включая подмену инструментов, ложные ошибки и внедрение вредоносных инструкций. Установлено: чем мощнее модель (например, GPT-5, Claude 4), тем выше риск взлома — средний успех атак достигает 40.35%. Команда представила тестовый стенд MSB с реалистичными сценариями и новым метриком NRP, оценивающим баланс между безопасностью и производительностью. Вывод: расширение возможностей AI через инструменты требует срочного усиления защиты, так как угрозы смещаются из текстовой среды в реальные системы.

Протокол MCP способствует автономному выполнению задач AI Agent, но риски безопасности резко возросли. Исследование показало, что злоумышленники могут использовать 12 методов, таких как подмена названий инструментов и ложные ошибки, чтобы обмануть Agent и заставить его выполнять вредоносные операции, от чего не застрахованы даже топовые модели. Команда Пекинского университета почты и связи выпустила эталон безопасности MSB, который через тестирование в реальной среде показывает: чем производительнее модель, тем она уязвимее. Новый показатель NRP впервые балансирует безопасность и практичность, предоставляя ключевой ориентир для укрепления защиты AI Agent.

Недавно такие проекты с открытым исходным кодом, как OpenClaw, стали вирусными в сообществе разработчиков. Всего одной фразы достаточно, чтобы Agent автоматически написал код, нашел информацию, поработал с локальными файлами и даже взял под контроль компьютер.

За этой поразительной автономностью Agent стоит возможность вызова инструментов, а протокол MCP (Model Context Protocol, протокол контекста модели) является интерфейсом, унифицирующим экосистему инструментов ИИ. Подобно тому, как USB-C позволяет компьютеру подключать различные устройства, MCP позволяет большим моделям стандартизированно вызывать внешние инструменты, такие как файловая система, браузер, базы данных и т.д.

Столкнувшись с такой огромной экосистемой, даже OpenClaw, изначально ориентированный на нативные командные строки, через адаптер подключился к MCP, чтобы получить более широкие инструментальные возможности.

Однако, когда «руки» ИИ становятся все длиннее, опасность также возрастает. Что, если инструмент, вызываемый Agent, отравлен хакером? Что, если в сообщении об ошибке, возвращаемом инструментом, скрыта вредоносная команда?

Когда большая модель беззащитно выполняет эти команды, ваши личные данные, локальные файлы и даже права доступа к серверу становятся добычей хакеров.

Чтобы заполнить пробел в оценке безопасности экосистемы MCP, исследовательская группа из Пекинского университета почты и связи и других учреждений представила专门针对的安全基准: MSB (MCP Security Bench). Исследование показало: атаки на каждом этапе MCP эффективны. Чем производительнее модель, тем она уязвимее для атак. Данная статья была принята на ICLR 2026.

Ссылка на статью: https://openreview.net/pdf?id=irxxkFMrry

Код: https://github.com/dongsenzhang/MSB

Риски безопасности MCP, стоящие за Agent

Рис. 1: Фреймворк атак MCP

MCP значительно расширяет возможности Agent, но также значительно расширяет поверхность атаки. В системе MCP процесс вызова инструментов Agent обычно включает три этапа:

1. Планирование задачи (Task Planning): Agent выбирает подходящий инструмент на основе запроса пользователя, используя название и описание инструмента.

2. Вызов инструмента (Tool Invocation): Agent отправляет запрос выбранному инструменту и передает соответствующие параметры для выполнения конкретных операций.

3. Обработка ответа (Response Handling): Agent анализирует результат ответа инструмента и на его основе продолжает рассуждения или формирует окончательный ответ.

Каждый этап может стать новой точкой входа для атаки. MSB охватывает полный этап вызова инструментов MCP и专门用于 оценки безопасности Agent, использующего инструменты на основе MCP, с тремя核心преимуществами:

Система классификации атак MCP

В рабочем процессе MCP Agent взаимодействует с инструментами через их идентификаторы (название и описание), параметры и ответы инструментов, и все это может стать путем для атаки. MSB классифицирует типы атак на основе этих путей и этапов взаимодействия:

Атака на сигнатуру инструмента (Tool Signature Attack): На этапе планирования задачи, атака с использованием названия и описания инструмента, включая:

Конфликт имен (Name Collision, NC): Создание вредоносного инструмента с названием, похожим на официальный, чтобы诱导Agent выбрать его.

Манипуляция предпочтениями (Preference Manipulation, PM): Внедрение рекламных语句 в описание инструмента, чтобы诱导Agent выбрать его.

Инъекция в подсказку (Prompt Injection, PI): Внедрение вредоносных инструкций в описание инструмента.

Атака через параметры инструмента (Tool Parameter Attack): На этапе вызова инструмента, атака с использованием параметров инструмента, включая:

Выход за пределы параметров (Out-of-Scope Parameter, OP): Установка параметров инструмента, выходящих за рамки нормальной функциональности, для передачи параметров, вызывающих утечку информации.

Атака через ответ инструмента (Tool Response Attack): На этапе обработки ответа, атака с использованием ответа инструмента, включая:

Выдача себя за пользователя (User Impersonation, UI): Выдача себя за пользователя для отдачи вредоносных команд.

Ложная ошибка (False Error, FE): Предоставление ложной информации об ошибке выполнения инструмента, требующей от Agent следования вредоносным инструкциям для успешного вызова инструмента.

Перенаправление инструмента (Tool Transfer, TT): Указание Agent вызвать вредоносный инструмент.

Атака инъекцией через поиск (Retrieval Injection Attack): На этапе обработки ответа, атака с использованием внешних ресурсов, включая:

Инъекция через поиск (Retrieval Injection, RI): Внешние ресурсы, содержащие внедренные вредоносные инструкции, нарушают контекст через ответ инструмента.

Смешанная атака (Mixed Attack): На нескольких этапах, одновременное использование нескольких компонентов инструмента для атаки, включая комбинации вышеуказанных атак.

Набор исполнения на основе реальной среды

MSB отвергает симуляционное тестирование на бумаге, он оснащен реальным сервером MCP, охватывает 10 реальных сценариев, 405 реальных инструментов и 2000 экземпляров атак. Все экземпляры выполняются через MCP с реальным выполнением инструментов,真实地 отражая实际操作环境, чтобы напрямую наблюдать степень破坏окружающего состояния атакой.

Балансирующий производительность и безопасность показатель NRP

В оценке безопасности Agent单纯看成功率 атак (ASR, Attack Success Rate) крайне обманчиво. Если Agent, чтобы избежать рисков, отказывается выполнять任何вызов инструментов, его ASR может быть близок к 0, но при этом он не может выполнить задачи пользователя и теряет практическую ценность.

Для этого MSB предлагает показатель чистой устойчивой производительности NRP, Net Resilient Performance:

NRP = PUA ⋅ (1 − ASR)

Где PUA (Performance Under Attack) — это доля задач пользователя, выполненных Agent в условиях противодействия, а ASR — это成功率 атак. NRP предназначен для оценки общей устойчивости Agent к рискам при抵抗атакам и сохранении производительности,提供平衡性能与安全的综合性量化标准.

Рис. 2: NRP vs ASR, NRP vs PUA.

Все методы атак эффективны

Рис. 3: Основные экспериментальные результаты.

Исследовательская группа провела масштабное тестирование 10 основных моделей, включая GPT-5, DeepSeek-V3.1, Claude 4 Sonnet, Qwen3, используя MSB. Все методы атак показали эффективность, общий средний ASR составил 40,35%. Среди них новые атаки, введенные MCP, более агрессивны. По сравнению с уже существующими атаками PI и RI в function calling, атаки на основе MCP, такие как UI и FE, имеют более высокую成功率. Смешанные атаки демонстрируют синергетическое усиление —成功率смешанных атак выше, чем у составляющих их атак.

Чем мощнее модель, тем она уязвимее

Взаимосвязь между различными показателями reveals контринтуитивный вывод: чем способнее модель, тем легче ее атаковать.

Рис. 4: PUA vs ASR.

В MSB выполнение атакующих задач все еще требует от Agent вызова инструментов, например, использование инструмента чтения файлов для получения личной информации. LLM с более высокой实用性的, благодаря их более出色的 инструментальным возможностям и способности следовать инструкциям, демонстрируют более высокий ASR. Это открытие揭示огромный实际风险уязвимостей безопасности MCP.

Повреждение среды на всех этапах и в многопользовательской среде

Рис. 5: ASR для разных этапов и конфигураций инструментов.

Дальнейший анализ с точки зрения рабочего процесса MCP и конфигурации инструментов показал, что на всех этапах MCP Agent уязвим для атак, причем на этапе вызова инструмента безопасность модели наименьшая.

Кроме того, атаки остаются эффективными даже в многопользовательской среде с безвредными инструментами. В реальных сценариях Agent обычно предоставляется набор инструментов, и даже при наличии безвредных инструментов такие методы诱导, как NC, PM и TT, все равно приводят к значительному успеху атак.

Итог

Взрывная популярность OpenClaw позволила людям直观地увидеть будущее Agent: большие модели больше не просто отвечают на вопросы, а начинают真正делать дела. MSB был предложен именно в этом контексте, он系统揭示потенциальные поверхности атак в экосистеме MCP и предоставляет воспроизводимую, измеримую системную基准оценки для исследований безопасности Agent.

Предыдущие исследования безопасности больших моделей в основном были сосредоточены на语言层面рисках, таких как инъекция в подсказки, в то время как MSB показывает, что когда ИИ вызывает инструменты и взаимодействует с реальными системами, поверхность атак также расширяется от текстового пространства до инструментальной экосистемы. По мере того как Agent постепенно становится новой парадигмой приложений ИИ, безопасность, возможно, становится порогом, который необходимо преодолеть для этого технологического скачка.

Источники:

https://openreview.net/pdf?id=irxxkFMrry

Данная статья из WeChat-аккаунта «新智元» (Новый век интеллекта), автор: 新智元

Связанные с этим вопросы

QЧто такое MCP (Model Context Protocol) и какую роль он играет в работе AI Agent?

AMCP (Model Context Protocol) — это стандартизированный интерфейс, который позволяет AI Agent взаимодействовать с внешними инструментами, такими как файловые системы, браузеры и базы данных. Он обеспечивает единый способ вызова инструментов, аналогично тому, как USB-C позволяет подключать различные устройства к компьютеру. Благодаря MCP, агенты могут автономно выполнять задачи, такие как написание кода, поиск информации и управление файлами.

QКакие основные типы атак на MCP были выявлены в исследовании MSB?

AИсследование MSB выявило 12 типов атак на MCP, включая: конфликт имён (Name Collision), манипуляцию предпочтениями (Preference Manipulation), инъекцию в подсказки (Prompt Injection), несанкционированные параметры (Out-of-Scope Parameter), имитацию пользователя (User Impersonation), ложные ошибки (False Error), перенаправление инструментов (Tool Transfer) и инъекцию через поиск (Retrieval Injection). Также существуют смешанные атаки, комбинирующие несколько методов.

QПочему более мощные модели AI, такие как GPT-5, более уязвимы к атакам через MCP?

AБолее мощные модели, такие как GPT-5, обладают улучшенными способностями к вызову инструментов и следованию инструкциям, что делает их более эффективными в выполнении задач, но также и более восприимчивыми к манипуляциям. Злоумышленники могут использовать эту способность, чтобы обманом заставить модель выполнять вредоносные действия, например, читать конфиденциальные файлы или выполнять несанкционированные команды.

QЧто такое показатель NRP (Net Resilient Performance) и почему он важен для оценки безопасности AI Agent?

ANRP (Net Resilient Performance) — это метрика, которая оценивает способность AI Agent противостоять атакам, сохраняя при этом производительность. Она рассчитывается как произведение доли успешно выполненных задач под атакой (PUA) на долю неуспешных атак (1 - ASR). NRP обеспечивает сбалансированную оценку, учитывающую как безопасность, так и практическую полезность агента, предотвращая ситуации, когда агент становится слишком осторожным и отказывается от выполнения любых действий.

QКакие практические риски возникают при использовании MCP в реальных средах?

AИспользование MCP в реальных средах сопряжено с рисками утечки конфиденциальных данных, несанкционированного доступа к файлам и системам, а также выполнения вредоносных команд. Атаки могут происходить на всех этапах работы MCP: при выборе инструмента, передаче параметров и обработке ответов. Даже в средах с множеством инструментов, включая безопасные, атаки остаются эффективными, что подчёркивает необходимость усиленных мер защиты.

Похожее

Проект Agorá БМР провел испытания токенизированных трансграничных платежей на сумму 1 млн долларов

Банк международных расчетов (БМР) сообщил об успешном завершении пилотных испытаний проекта Agorá, в ходе которых были проведены реальные расчеты с использованием токенизированных активов для трансграничных платежей. В тестах, состоявшихся в июле, приняли участие 28 финансовых институтов и центральных банков, включая Банк Англии, Банк Франции, Банк Японии, Банк Кореи и Швейцарский национальный банк, а также крупные коммерческие банки, такие как JPMorgan Chase, Citibank и Deutsche Bank. В рамках 17 различных сценариев транзакций было урегулировано около 800 000 швейцарских франков (примерно 1 млн долларов США) с использованием токенизированных резервов центральных банков и коммерческих банковских депозитов в шести валютах: швейцарских франках, евро, фунтах стерлингов, японских иенах, южнокорейских вонах и долларах США. Среднее время расчетов составило около 80 секунд. Проект Agorá, запущенный БМР в 2024 году, направлен на исследование возможностей улучшения трансграничных оптовых платежей с помощью технологии токенизации. Ранее, в мае, проект уже демонстрировал возможность атомарных расчетов в нескольких валютах и юрисдикциях. БМР назвал июльские испытания важной вехой и отметил, что тестирование будет продолжено по мере развития инициативы.

cointelegraph4 мин. назад

Проект Agorá БМР провел испытания токенизированных трансграничных платежей на сумму 1 млн долларов

cointelegraph4 мин. назад

Критический день на криптовалютном рынке: резкий рост стоимости опционов на биткоин и эфириум на 10,5 миллиардов долларов! Чего ожидают инвесторы?

Основная криптовалюта, биткоин, торгуется вблизи уровня 64 000 долларов в условиях неопределённости, вызванной политикой ФРС США и геополитической напряжённостью на Ближнем Востоке. В центре внимания рынка — крупные опционные контракты на сумму около 9,7 млрд долларов, срок действия которых истекает в последнюю пятницу месяца, 31 июля. Из них 9,69 млрд долларов приходятся на биткоин и 830 млн на эфириум. Ключевой индикатор — соотношение путы/коллы — составляет 0,28 для биткоина и 0,63 для эфириума. Низкое значение для BTC (0,28) указывает на преобладание опционов колл и доминирование бычьих настроений среди инвесторов, которые ожидают роста цены. Для ETH соотношение также свидетельствует о доминировании коллов, но оно выше, что говорит о большей осторожности трейдеров по сравнению с биткоином. Эксперты подчёркивают, что, хотя данные опционы важны, они не являются единственным фактором, определяющим цены. Макроэкономические события и общие рыночные настроения продолжают играть решающую роль в динамике криптовалютного рынка.

cryptonews.ru18 мин. назад

Критический день на криптовалютном рынке: резкий рост стоимости опционов на биткоин и эфириум на 10,5 миллиардов долларов! Чего ожидают инвесторы?

cryptonews.ru18 мин. назад

Анализ влияния ИИ на экономический рост и производительность

**Анализ влияния ИИ на экономический рост и производительность** Существуют три основных подхода к оценке влияния ИИ на экономику: оптимистичный, умеренный и пессимистичный. **Оптимисты** верят, что ИИ, способный автоматизировать НИОКР, может привести к резкому ускорению экономического роста, вплоть до "сингулярности" – взрывного, самоподдерживающегося роста. **Умеренные исследователи** признают потенциальный рост производительности, но подчеркивают множество ограничений: ограниченный выигрыш в эффективности для отдельных задач, структурные пределы автоматизации многих профессий (особенно требующих физических действий), физические и энергетические ограничения инфраструктуры, регуляторные барьеры. Эти факторы могут значительно снизить итоговую экономическую выгоду от ИИ. **Пессимисты** либо крайне скептически оценивают скорость и масштабы внедрения ИИ, либо фокусируются на рисках. Они предупреждают, что если ИИ в первую очередь будет *заменять* труд, а не *дополнять* его, это может снизить долю трудовых доходов. Это, в свою очередь, ослабит потребительский спрос и в конечном итоге затормозит экономический рост, создав "ловушку спроса". **Краткосрочный прогноз (1-2 года):** Основной вклад ИИ в рост ВВП будет обеспечиваться за счет инвестиционного бума (например, в инфраструктуру для обработки данных), а не за счет немедленного роста производительности. Данные обследований компаний показывают, что ощутимого влияния на производительность пока нет. **Среднесрочный прогноз (3-5 года):** Авторы выделяют три возможных сценария развития: 1. **Оптимистичный:** Быстрое внедрение без серьезных препятствий ведет к значительному росту производительности. Однако это может вызвать массовую замену рабочих мест и усиление неравенства, что социально неблагоприятно. 2. **Умеренный (наиболее вероятный):** Внедрение ИИ сталкивается с рядом преодолимых, но замедляющих его ограничений (технических, инфраструктурных, регуляторных). Рост производительности будет умеренным, отраслевое воздействие — неравномерным, возможны структурная безработица и волатильность на финансовых рынках. 3. **Пессимистичный:** Спрос на ИИ-приложения не оправдывает ожиданий, или технологии сталкиваются с непреодолимыми "узкими местами". Это приведет к коррекции на финансовых рынках, но замедлит вытеснение рабочих мест, что может быть социально более стабильным. **Вывод:** Путь к долгосрочному процветанию благодаря ИИ вряд ли будет гладким. Даже технически оптимистичный сценарий может иметь негативные социальные последствия без продуманной политики перераспределения доходов. Властям необходимо комплексно учитывать эти риски, отслеживать развитие ситуации и заранее готовить меры для обеспечения устойчивого и инклюзивного экономического роста.

marsbit26 мин. назад

Анализ влияния ИИ на экономический рост и производительность

marsbit26 мин. назад

Предупреждение о мошенничестве IRS: Поддельные письма нацелены на держателей криптовалют в схеме похищения данных

IRS предупреждает о новой фишинговой атаке, нацеленной на владельцев криптовалют. Мошенники рассылают поддельные бумажные письма, стилизованные под официальные уведомления Налоговой службы США. Письма содержат QR-код, который ведёт на фальшивый сайт "Портала соответствия цифровых активов" — этот портал не существует. Цель — похитить личные данные и получить доступ к цифровым активам жертв. Афера использует тот факт, что с 2019 года IRS действительно рассылает письма по вопросам отчётности по криптовалюте, что делает поддельные сообщения правдоподобными. Ключевые признаки мошенничества: наличие QR-кода в письме (IRS не использует их в официальной переписке), требования зарегистрироваться на несуществующем портале или перевести криптоактивы. Если вы получили такое письмо, не сканируйте QR-код, не звоните по указанным номерам и не вводите личные данные на связанных сайтах. Всю информацию о корреспонденции от IRS следует проверять исключительно через официальный сайт IRS.gov. Налоговая служба никогда не требует перевода цифровых активов в рамках проверок.

TheNewsCrypto31 мин. назад

Предупреждение о мошенничестве IRS: Поддельные письма нацелены на держателей криптовалют в схеме похищения данных

TheNewsCrypto31 мин. назад

Еженедельник RWA: Десять европейских финансовых учреждений создают кооператив по токенизации активов; Ondo запускает новую сеть исполнения Ondo Network

**RWA周报: 24-31 июля 2026 г.** Общая капитализация RWA на блокчейне остаётся стабильной на уровне $36,8 млрд, а число держателей достигло исторического максимума. Однако объёмы переводов стейблкоинов продолжают снижаться, что указывает на низкую активность расчетов в сети и состояние "застоя". В сфере регулирования Южная Корея планирует ввести правила для стейблкоинов, в то время как оппозиция добивается отмены налога на криптовалюты. Кения снизила капитальные требования для эмитентов, а Зимбабве запустила регулируемую песочницу. В части развития проектов: * BIS успешно протестировал проект Agorá, осуществив кросс-граничные платежи на $1 млн с использованием токенизированных средств за ~80 секунд. * 10 европейских финансовых институтов основали кооператив RL1 для создания инфраструктуры токенизированных активов. * POSCO International и LG CNS токенизируют коммерческие счета-фактуры в сети Injective. * Бразильские фермеры привлекли финансирование под залог коров, оснащенных "умными" ошейниками для отслеживания. * Bank of New York Mellon переносит ключевые реестровые функции на блокчейн. * Ondo Finance запустила новую сеть исполнения Ondo Network. Несмотря на рост объёма выпущенных активов, около 90% токенизированных RWA остаются неиспользуемыми в DeFi. Конкуренция смещается от выпуска активов к созданию приложений и каналов их распределения. Одновременно на рынке стейблкоинов появляется новый игрок — OUSD от альянса Open Standard, который бросает вызов USDC, предлагая модель распределения доходов от резервов среди партнёров.

marsbit37 мин. назад

Еженедельник RWA: Десять европейских финансовых учреждений создают кооператив по токенизации активов; Ondo запускает новую сеть исполнения Ondo Network

marsbit37 мин. назад

Торговля

Спот
活动图片