Протокол MCP способствует автономному выполнению задач AI Agent, но риски безопасности резко возросли. Исследование показало, что злоумышленники могут использовать 12 методов, таких как подмена названий инструментов и ложные ошибки, чтобы обмануть Agent и заставить его выполнять вредоносные операции, от чего не застрахованы даже топовые модели. Команда Пекинского университета почты и связи выпустила эталон безопасности MSB, который через тестирование в реальной среде показывает: чем производительнее модель, тем она уязвимее. Новый показатель NRP впервые балансирует безопасность и практичность, предоставляя ключевой ориентир для укрепления защиты AI Agent.
Недавно такие проекты с открытым исходным кодом, как OpenClaw, стали вирусными в сообществе разработчиков. Всего одной фразы достаточно, чтобы Agent автоматически написал код, нашел информацию, поработал с локальными файлами и даже взял под контроль компьютер.
За этой поразительной автономностью Agent стоит возможность вызова инструментов, а протокол MCP (Model Context Protocol, протокол контекста модели) является интерфейсом, унифицирующим экосистему инструментов ИИ. Подобно тому, как USB-C позволяет компьютеру подключать различные устройства, MCP позволяет большим моделям стандартизированно вызывать внешние инструменты, такие как файловая система, браузер, базы данных и т.д.
Столкнувшись с такой огромной экосистемой, даже OpenClaw, изначально ориентированный на нативные командные строки, через адаптер подключился к MCP, чтобы получить более широкие инструментальные возможности.
Однако, когда «руки» ИИ становятся все длиннее, опасность также возрастает. Что, если инструмент, вызываемый Agent, отравлен хакером? Что, если в сообщении об ошибке, возвращаемом инструментом, скрыта вредоносная команда?
Когда большая модель беззащитно выполняет эти команды, ваши личные данные, локальные файлы и даже права доступа к серверу становятся добычей хакеров.
Чтобы заполнить пробел в оценке безопасности экосистемы MCP, исследовательская группа из Пекинского университета почты и связи и других учреждений представила专门针对的安全基准: MSB (MCP Security Bench). Исследование показало: атаки на каждом этапе MCP эффективны. Чем производительнее модель, тем она уязвимее для атак. Данная статья была принята на ICLR 2026.

Ссылка на статью: https://openreview.net/pdf?id=irxxkFMrry
Код: https://github.com/dongsenzhang/MSB
Риски безопасности MCP, стоящие за Agent

Рис. 1: Фреймворк атак MCP
MCP значительно расширяет возможности Agent, но также значительно расширяет поверхность атаки. В системе MCP процесс вызова инструментов Agent обычно включает три этапа:
1. Планирование задачи (Task Planning): Agent выбирает подходящий инструмент на основе запроса пользователя, используя название и описание инструмента.
2. Вызов инструмента (Tool Invocation): Agent отправляет запрос выбранному инструменту и передает соответствующие параметры для выполнения конкретных операций.
3. Обработка ответа (Response Handling): Agent анализирует результат ответа инструмента и на его основе продолжает рассуждения или формирует окончательный ответ.
Каждый этап может стать новой точкой входа для атаки. MSB охватывает полный этап вызова инструментов MCP и专门用于 оценки безопасности Agent, использующего инструменты на основе MCP, с тремя核心преимуществами:
Система классификации атак MCP
В рабочем процессе MCP Agent взаимодействует с инструментами через их идентификаторы (название и описание), параметры и ответы инструментов, и все это может стать путем для атаки. MSB классифицирует типы атак на основе этих путей и этапов взаимодействия:
Атака на сигнатуру инструмента (Tool Signature Attack): На этапе планирования задачи, атака с использованием названия и описания инструмента, включая:
Конфликт имен (Name Collision, NC): Создание вредоносного инструмента с названием, похожим на официальный, чтобы诱导Agent выбрать его.
Манипуляция предпочтениями (Preference Manipulation, PM): Внедрение рекламных语句 в описание инструмента, чтобы诱导Agent выбрать его.
Инъекция в подсказку (Prompt Injection, PI): Внедрение вредоносных инструкций в описание инструмента.
Атака через параметры инструмента (Tool Parameter Attack): На этапе вызова инструмента, атака с использованием параметров инструмента, включая:
Выход за пределы параметров (Out-of-Scope Parameter, OP): Установка параметров инструмента, выходящих за рамки нормальной функциональности, для передачи параметров, вызывающих утечку информации.
Атака через ответ инструмента (Tool Response Attack): На этапе обработки ответа, атака с использованием ответа инструмента, включая:
Выдача себя за пользователя (User Impersonation, UI): Выдача себя за пользователя для отдачи вредоносных команд.
Ложная ошибка (False Error, FE): Предоставление ложной информации об ошибке выполнения инструмента, требующей от Agent следования вредоносным инструкциям для успешного вызова инструмента.
Перенаправление инструмента (Tool Transfer, TT): Указание Agent вызвать вредоносный инструмент.
Атака инъекцией через поиск (Retrieval Injection Attack): На этапе обработки ответа, атака с использованием внешних ресурсов, включая:
Инъекция через поиск (Retrieval Injection, RI): Внешние ресурсы, содержащие внедренные вредоносные инструкции, нарушают контекст через ответ инструмента.
Смешанная атака (Mixed Attack): На нескольких этапах, одновременное использование нескольких компонентов инструмента для атаки, включая комбинации вышеуказанных атак.
Набор исполнения на основе реальной среды
MSB отвергает симуляционное тестирование на бумаге, он оснащен реальным сервером MCP, охватывает 10 реальных сценариев, 405 реальных инструментов и 2000 экземпляров атак. Все экземпляры выполняются через MCP с реальным выполнением инструментов,真实地 отражая实际操作环境, чтобы напрямую наблюдать степень破坏окружающего состояния атакой.
Балансирующий производительность и безопасность показатель NRP
В оценке безопасности Agent单纯看成功率 атак (ASR, Attack Success Rate) крайне обманчиво. Если Agent, чтобы избежать рисков, отказывается выполнять任何вызов инструментов, его ASR может быть близок к 0, но при этом он не может выполнить задачи пользователя и теряет практическую ценность.
Для этого MSB предлагает показатель чистой устойчивой производительности NRP, Net Resilient Performance:
NRP = PUA ⋅ (1 − ASR)
Где PUA (Performance Under Attack) — это доля задач пользователя, выполненных Agent в условиях противодействия, а ASR — это成功率 атак. NRP предназначен для оценки общей устойчивости Agent к рискам при抵抗атакам и сохранении производительности,提供平衡性能与安全的综合性量化标准.

Рис. 2: NRP vs ASR, NRP vs PUA.
Все методы атак эффективны

Рис. 3: Основные экспериментальные результаты.
Исследовательская группа провела масштабное тестирование 10 основных моделей, включая GPT-5, DeepSeek-V3.1, Claude 4 Sonnet, Qwen3, используя MSB. Все методы атак показали эффективность, общий средний ASR составил 40,35%. Среди них новые атаки, введенные MCP, более агрессивны. По сравнению с уже существующими атаками PI и RI в function calling, атаки на основе MCP, такие как UI и FE, имеют более высокую成功率. Смешанные атаки демонстрируют синергетическое усиление —成功率смешанных атак выше, чем у составляющих их атак.
Чем мощнее модель, тем она уязвимее
Взаимосвязь между различными показателями reveals контринтуитивный вывод: чем способнее модель, тем легче ее атаковать.

Рис. 4: PUA vs ASR.
В MSB выполнение атакующих задач все еще требует от Agent вызова инструментов, например, использование инструмента чтения файлов для получения личной информации. LLM с более высокой实用性的, благодаря их более出色的 инструментальным возможностям и способности следовать инструкциям, демонстрируют более высокий ASR. Это открытие揭示огромный实际风险уязвимостей безопасности MCP.
Повреждение среды на всех этапах и в многопользовательской среде

Рис. 5: ASR для разных этапов и конфигураций инструментов.
Дальнейший анализ с точки зрения рабочего процесса MCP и конфигурации инструментов показал, что на всех этапах MCP Agent уязвим для атак, причем на этапе вызова инструмента безопасность модели наименьшая.
Кроме того, атаки остаются эффективными даже в многопользовательской среде с безвредными инструментами. В реальных сценариях Agent обычно предоставляется набор инструментов, и даже при наличии безвредных инструментов такие методы诱导, как NC, PM и TT, все равно приводят к значительному успеху атак.
Итог
Взрывная популярность OpenClaw позволила людям直观地увидеть будущее Agent: большие модели больше не просто отвечают на вопросы, а начинают真正делать дела. MSB был предложен именно в этом контексте, он系统揭示потенциальные поверхности атак в экосистеме MCP и предоставляет воспроизводимую, измеримую системную基准оценки для исследований безопасности Agent.
Предыдущие исследования безопасности больших моделей в основном были сосредоточены на语言层面рисках, таких как инъекция в подсказки, в то время как MSB показывает, что когда ИИ вызывает инструменты и взаимодействует с реальными системами, поверхность атак также расширяется от текстового пространства до инструментальной экосистемы. По мере того как Agent постепенно становится новой парадигмой приложений ИИ, безопасность, возможно, становится порогом, который необходимо преодолеть для этого технологического скачка.
Источники:
https://openreview.net/pdf?id=irxxkFMrry
Данная статья из WeChat-аккаунта «新智元» (Новый век интеллекта), автор: 新智元





