Кто действительно является сильнейшим агентом OpenClaw? Опубликован рейтинг из 23 реальных задач

marsbitОпубликовано 2026-04-08Обновлено 2026-04-08

Введение

Рейтинг лучших AI-агентов OpenClaw: опубликованы результаты тестирования 23 реальных задач. Платформа MyToken представила прозрачный бенчмарк, оценивающий способности моделей на основе успешного выполнения задач. Ключевой критерий — процент успеха (Success Rate). Тестирование включало 23 задачи: от создания событий в календаре и анализа акций до написания блогов и исследования рынка. Использовались три метода оценки: автоматизированная проверка, оценка моделью-судьёй (Claude Opus) и гибридный подход. Топ-10 моделей по успешности (Best % / Avg %): 1. anthropic/claude-opus-4.6 — 93.3% / 82.0% 2. arcee-ai/trinity-large-thinking — 91.9% / 91.9% 3. openai/gpt-5.4 — 90.5% / 81.7% 4. qwen/qwen3.5-27b — 90.0% / 78.5% 5. minimax/minimax-m2.7 — 89.8% / 83.2% Claude Opus показал наивысший результат, но Trinity от Arcee выделился стабильностью. Все методики и данные открыты для проверки.

Хотите узнать, какая большая языковая модель действительно сильнее всего в реальных задачах агента OpenClaw?

MyToken на основе сайта с тестами подготовил прозрачный бенчмарк, сфокусированный на оценке практических способностей ИИ-агентов для программирования, рассматривая только одно ключевое измерение — успешность (скорость и стоимость относятся к другим независимым измерениям, которые будут проанализированы отдельно позже). Полностью открытый, воспроизводимый, представляющий только строгие стандарты тестирования + актуальный Топ-10 рейтинг по успешности.

I. Измерение для оценки:Успешность

Конкретный стандарт: доля задач, которые ИИ-агент точно и полностью выполняет. Каждая задача использует высокостандартизированный процесс:

  • Точные пользовательские промпты (Prompt)

Отправляются агенту для имитации реальных сценариев пользовательских запросов

  • Ожидаемое поведение (Expected Behavior)

Указываются приемлемые способы реализации и ключевые моменты принятия решений

  • Критерии оценки (checklist)

Предоставляется атомизированный список критериев успеха для поэтапной проверки

II. Три метода оценки

В этом тестировании в основном используются 3 метода оценки:

  • Автоматическая проверка: Python-скрипты напрямую проверяют объективные результаты, такие как содержимое файлов, записи выполнения, вызовы инструментов

  • Судья LLM-модель: Claude Opus выставляет оценки по подробной шкале (качество контента, уместность, полнота и т.д.)

  • Смешанный режим: сочетание автоматической объективной проверки и качественной оценки судьей LLM

Все определения задач, промпты, логика оценки полностью открыты для повторного тестирования и проверки.

III. Задачи, используемые для оценки

Этот бенчмарк охватывает 23 задачи разных категорий. Охватывает множество измерений: базовое взаимодействие, операции с файлами/кодом, создание контента, исследовательский анализ, вызов системных инструментов, постоянство памяти и другие, что高度 соответствует повседневным сценариям использования OpenClaw разработчиками:

  1. Sanity Check(Автоматизация) — Обработка простых инструкций и корректный ответ на приветствие

  2. Calendar Event Creation(Автоматизация) — Генерация стандартного ICS-файла календаря на естественном языке

  3. Stock Price Research(Автоматизация) — Запрос актуальной цены акций и вывод отформатированного отчета

  4. Blog Post Writing(Судья LLM) — Написание структурированного Markdown-блога объемом около 500 слов

  5. Weather Script Creation(Автоматизация) — Написание Python-скрипта для погодного API с обработкой ошибок

  6. Document Summarization(Судья LLM) — 3-этапное сжатое изложение основных тем

  7. Tech Conference Research(Судья LLM) — Исследование и систематизация информации о 5 реальных tech-конференциях (название, дата, место, ссылка)

  8. Professional Email Drafting(Судья LLM) — Вежливый отказ от встречи с предложением альтернативы

  9. Memory Retrieval from Context(Автоматизация) — Точное извлечение дат, участников, технологического стека и т.д. из проектных заметок

  10. File Structure Creation(Автоматизация) — Автоматическое создание стандартной структуры проекта, README, .gitignore

  11. Multi-step API Workflow(Смешанный) — Чтение конфигурации → Написание скрипта вызова → Полная документация

  12. Install ClawdHub Skill(Автоматизация) — Установка из репозитория навыков и проверка работоспособности

  13. Search and Install Skill(Автоматизация) — Поиск погодных навыков и корректная установка

  14. AI Image Generation(Смешанный) — Генерация и сохранение изображения по описанию

  15. Humanize AI-Generated Blog(Судья LLM) — Преобразование машинного контента в естественную разговорную речь

  16. Daily Research Summary(Судья LLM) — Синтез связного ежедневного резюме из нескольких документов

  17. Email Inbox Triage(Смешанный) — Анализ нескольких писем и составление отчета по степени срочности

  18. Email Search and Summarization(Смешанный) — Поиск в архиве писем и извлечение ключевой информации

  19. Competitive Market Research(Смешанный) — Анализ конкурентов в области корпоративных APM

  20. CSV and Excel Summarization(Смешанный) — Анализ табличных файлов и вывод инсайтов

  21. ELI5 PDF Summarization(Судья LLM) — Объяснение технического PDF-файла языком, понятным 5-летнему ребенку

  22. OpenClaw Report Comprehension(Автоматизация) — Точный ответ на конкретные вопросы из PDF-отчета исследования

  23. Second Brain Knowledge Persistence(Смешанный) — Межсессионное хранение и точное воспроизведение информации

IV. Ключевой вывод: Рейтинг Топ-10 больших моделей по успешности (Лучший %/Средний %)

  • Данные обновлены по состоянию на 7 апреля 2026 года

  • Лучший % — наивысшая единичная успешность, Средний % — средняя успешность за несколько попыток, лучше отражает стабильность

以下是成功率最高的前十模型

  1. anthropic/claude-opus-4.6(Anthropic) — 93.3% / 82.0%

  2. arcee-ai/trinity-large-thinking(Arcee AI) — 91.9% / 91.9%

  3. openai/gpt-5.4(OpenAI) — 90.5% / 81.7%

  4. qwen/qwen3.5-27b(Qwen) — 90.0% / 78.5%

  5. minimax/minimax-m2.7(MiniMax) — 89.8% / 83.2%

  6. anthropic/claude-haiku-4.5(Anthropic) — 89.5% / 78.1%

  7. qwen/qwen3.5-397b-a17b(Qwen) — 89.1% / 80.4%

  8. xiaomi/mimo-v2-flash(Xiaomi) — 88.8% / 70.2%

  9. qwen/qwen3.6-plus-preview(Qwen) — 88.6% / 84.0%

  10. nvidia/nemotron-3-super-120b-a12b(NVIDIA) — 88.6% / 75.5%

Claude Opus 4.6 в настоящее время лидирует с наивысшей успешностью 93.3%, но Trinity от Arcee демонстрирует впечатляющие результаты по средней стабильности. Серия Qwen также имеет несколько моделей в топ-10, показывая большой потенциал с точки зрения соотношения цены и качества. Успешность — это базовый порог, последующие измерения скорости и стоимости будут further влиять на фактический опыт.

Этот бенчмарк из 23 задач полностью прозрачен, настоятельно рекомендуем протестировать его в соответствии с вашими сценариями. Больше рейтингов других моделей ждите в即将推出的 функции рейтинга агентов от MyToken.

(Данные来源于открытого бенчмарка тестирования агентов OpenClaw от PinchBench, постоянно обновляются.)

Связанные с этим вопросы

QКакой показатель является основным критерием оценки в тестировании OpenClaw агентов?

AОсновным критерием оценки является процент успешного выполнения (Success Rate) — доля задач, которые агент смог выполнить полностью и точно.

QКакие три метода оценки использовались в тестировании?

AИспользовались три метода: автоматизированная проверка скриптами, оценка моделью ИИ-судьей (Claude Opus) и гибридный режим, сочетающий автоматическую проверку и качественную оценку ИИ.

QКакая модель показала наивысший максимальный процент успеха (Best %)?

AМодель anthropic/claude-opus-4.6 (от Anthropic) показала наивысший максимальный процент успеха — 93.3%.

QКакая модель продемонстрировала наилучшую стабильность результатов (самый высокий средний процент успеха Avg %)?

AМодель arcee-ai/trinity-large-thinking (от Arcee AI) продемонстрировала наилучшую стабильность с самым высоким средним процентом успеха — 91.9%.

QСколько всего задач было включено в бенчмарк для тестирования?

AВ бенчмарк было включено 23 задачи, охватывающих различные аспекты: базовое взаимодействие, работу с файлами и кодом, создание контента, исследования, системные вызовы и сохранение памяти.

Похожее

Внимание: на этой неделе произойдёт масштабное разблокирование токенов в 10 альткоинах! Вот список по дням и часам

В последнюю неделю рынок криптовалют испытал спад из-за хакерской атаки на аппаратный кошелек ColdCard и влияния геополитических событий. Однако на текущей неделе ожидается масштабное разблокирование токенов в 10 альткоинах, что может оказать значительное влияние на их рынки. Все время указано по UTC+3. Основные события разблокировки: * **4 августа, 03:00:** Lagrange (LGN) – разблокируется токенов на $1,38 млн (15.04% от рыночной стоимости). * **5 августа, 03:00:** Proof (PROOF) – разблокируется на $39,11 млн (119.59%), Power Protocol (POWER) – на $1,62 млн (8.93%), Verona (VERONA) – на $1,37 млн (12.61%). * **5 августа, 11:00:** Ethereum (ENA) – разблокируется на $15,28 млн (1.80%). * **6 августа, 03:00:** Goldfinger (GF) – на $11,52 млн (5.05%). * **7 августа, 03:00:** Infinity (INF) – на $2,31 млн (20.30%). * **8 августа, 03:00:** Stable (STBL) – на $28,75 млн (3.55%). * **9 августа, 03:00:** Name (NAME) – на $48,47 млн (74.54%), Move (MOVE) – на $1,22 млн (3.90%). Особое внимание стоит обратить на проекты Proof и Name, где объем разблокировки существенно превышает текущую рыночную капитализацию. Это не является инвестиционной рекомендацией.

cryptonews.ru5 мин. назад

Внимание: на этой неделе произойдёт масштабное разблокирование токенов в 10 альткоинах! Вот список по дням и часам

cryptonews.ru5 мин. назад

За $100 000 в месяц: Truth Social продает доступ к постам Трампа инвестиционным фирмам

Корпорация Trump Media and Technology Group (TMTG) запустила платный сервис Truth API, предоставляющий институциональным инвесторам и фирмам, занимающимся высокочастотной торговлей, мгновенный доступ к постам самых влиятельных аккаунтов в Truth Social, включая аккаунт экс-президента Дональда Трампа. Стоимость подписки, по данным источников, может достигать $100 000 в месяц. Компания позиционирует это как стратегию по извлечению прибыли из собственных активов. Инициатива вызвала критику со стороны ряда сенаторов-демократов и республиканцев, которые обвинили TMTG в продаже привилегированного доступа к постам президента и потребовали проверки со стороны SEC. В ответ компания заявила о скоординированной кампании по нанесению вреда её бизнесу. Анализ отмечает, что подобный сервис создает архитектуру риска, аналогичную случаям, когда торговые алгоритмы в прошлом вызывали обвал рынков, реагируя на фейковые сообщения в соцсетях. Отсутствие встроенного механизма верификации постов в реальном времени делает платформу потенциальной целью для манипуляций.

cryptonews.ru2 ч. назад

За $100 000 в месяц: Truth Social продает доступ к постам Трампа инвестиционным фирмам

cryptonews.ru2 ч. назад

Дивиденды по привилегированным акциям STRC остаются на уровне 12% несмотря на цену ниже номинала

Хотя привилегированные акции STRC компании Strategy завершили июль значительно ниже номинальной стоимости в $100, инвесторам сообщили, что дивиденд за август останется на уровне 12% и не будет увеличен. Акции закрылись 2 августа на уровне $89.46. Генеральный директор Фонг Ле подтвердил, что корпоративная цель — достичь торговли акциями в диапазоне $99-$100, но не уточнил сроки. В июле компания сообщила о чистом убытке в $8.22 млрд за второй квартал, в основном из-за нереализованных потерь на хранении биткоина. Для обеспечения выплат по привилегированным акциям Strategy создала денежный резерв в $3.75 млрд, которого хватит более чем на два года. Компания также выкупила часть своих привилегированных акций со скидкой и намерена продолжать покупки, пока они торгуются ниже номинала.

cointelegraph4 ч. назад

Дивиденды по привилегированным акциям STRC остаются на уровне 12% несмотря на цену ниже номинала

cointelegraph4 ч. назад

Вывод биткоинов продолжается: 8 лет хранения в холодном кошельке Coldcard закончились нулем

Аппаратный кошелек Coldcard оказался уязвимым, что привело к масштабному выводу средств. По данным Galaxy Research на 2 августа 2026 года, похищено уже более 1367 BTC (около $88.6 млн) с 4585 адресов. Проблема связана не с прошивкой, а с seed-фразами, сгенерированными на уязвимых устройствах в определенный период (Mk2/Mk3 с прошивкой 4.0.1–4.1.9; Mk4/Mk5 до версии 5.6.0; Q до версии 1.5.0Q). Причина — ошибка в интеграции библиотеки libNgU, из-за которой устройство перестало использовать аппаратный генератор случайных чисел, перейдя на предсказуемый программный. Обновление прошивки не меняет существующую seed-фразу, поэтому владельцам необходимо сгенерировать новую на исправленной версии и перевести активы. Статья приводит трагичный пример 39-летнего инвестора, который за 8 лет накопил 2 BTC тяжелым трудом, храня их в Coldcard как защиту от гиперинфляции в своей стране, но потерял все за минуты из-за этой уязвимости. Этот случай показывает, что даже стратегия холодного хранения не является абсолютно надежной, особенно когда уязвимость кроется в самом генераторе случайных чисел внутри изолированного устройства.

cryptonews.ru4 ч. назад

Вывод биткоинов продолжается: 8 лет хранения в холодном кошельке Coldcard закончились нулем

cryptonews.ru4 ч. назад

Торговля

Спот
活动图片