Кто действительно является сильнейшим агентом OpenClaw? Опубликован рейтинг из 23 реальных задач

marsbitОпубликовано 2026-04-08Обновлено 2026-04-08

Введение

Рейтинг лучших AI-агентов OpenClaw: опубликованы результаты тестирования 23 реальных задач. Платформа MyToken представила прозрачный бенчмарк, оценивающий способности моделей на основе успешного выполнения задач. Ключевой критерий — процент успеха (Success Rate). Тестирование включало 23 задачи: от создания событий в календаре и анализа акций до написания блогов и исследования рынка. Использовались три метода оценки: автоматизированная проверка, оценка моделью-судьёй (Claude Opus) и гибридный подход. Топ-10 моделей по успешности (Best % / Avg %): 1. anthropic/claude-opus-4.6 — 93.3% / 82.0% 2. arcee-ai/trinity-large-thinking — 91.9% / 91.9% 3. openai/gpt-5.4 — 90.5% / 81.7% 4. qwen/qwen3.5-27b — 90.0% / 78.5% 5. minimax/minimax-m2.7 — 89.8% / 83.2% Claude Opus показал наивысший результат, но Trinity от Arcee выделился стабильностью. Все методики и данные открыты для проверки.

Хотите узнать, какая большая языковая модель действительно сильнее всего в реальных задачах агента OpenClaw?

MyToken на основе сайта с тестами подготовил прозрачный бенчмарк, сфокусированный на оценке практических способностей ИИ-агентов для программирования, рассматривая только одно ключевое измерение — успешность (скорость и стоимость относятся к другим независимым измерениям, которые будут проанализированы отдельно позже). Полностью открытый, воспроизводимый, представляющий только строгие стандарты тестирования + актуальный Топ-10 рейтинг по успешности.

I. Измерение для оценки:Успешность

Конкретный стандарт: доля задач, которые ИИ-агент точно и полностью выполняет. Каждая задача использует высокостандартизированный процесс:

  • Точные пользовательские промпты (Prompt)

Отправляются агенту для имитации реальных сценариев пользовательских запросов

  • Ожидаемое поведение (Expected Behavior)

Указываются приемлемые способы реализации и ключевые моменты принятия решений

  • Критерии оценки (checklist)

Предоставляется атомизированный список критериев успеха для поэтапной проверки

II. Три метода оценки

В этом тестировании в основном используются 3 метода оценки:

  • Автоматическая проверка: Python-скрипты напрямую проверяют объективные результаты, такие как содержимое файлов, записи выполнения, вызовы инструментов

  • Судья LLM-модель: Claude Opus выставляет оценки по подробной шкале (качество контента, уместность, полнота и т.д.)

  • Смешанный режим: сочетание автоматической объективной проверки и качественной оценки судьей LLM

Все определения задач, промпты, логика оценки полностью открыты для повторного тестирования и проверки.

III. Задачи, используемые для оценки

Этот бенчмарк охватывает 23 задачи разных категорий. Охватывает множество измерений: базовое взаимодействие, операции с файлами/кодом, создание контента, исследовательский анализ, вызов системных инструментов, постоянство памяти и другие, что高度 соответствует повседневным сценариям использования OpenClaw разработчиками:

  1. Sanity Check(Автоматизация) — Обработка простых инструкций и корректный ответ на приветствие

  2. Calendar Event Creation(Автоматизация) — Генерация стандартного ICS-файла календаря на естественном языке

  3. Stock Price Research(Автоматизация) — Запрос актуальной цены акций и вывод отформатированного отчета

  4. Blog Post Writing(Судья LLM) — Написание структурированного Markdown-блога объемом около 500 слов

  5. Weather Script Creation(Автоматизация) — Написание Python-скрипта для погодного API с обработкой ошибок

  6. Document Summarization(Судья LLM) — 3-этапное сжатое изложение основных тем

  7. Tech Conference Research(Судья LLM) — Исследование и систематизация информации о 5 реальных tech-конференциях (название, дата, место, ссылка)

  8. Professional Email Drafting(Судья LLM) — Вежливый отказ от встречи с предложением альтернативы

  9. Memory Retrieval from Context(Автоматизация) — Точное извлечение дат, участников, технологического стека и т.д. из проектных заметок

  10. File Structure Creation(Автоматизация) — Автоматическое создание стандартной структуры проекта, README, .gitignore

  11. Multi-step API Workflow(Смешанный) — Чтение конфигурации → Написание скрипта вызова → Полная документация

  12. Install ClawdHub Skill(Автоматизация) — Установка из репозитория навыков и проверка работоспособности

  13. Search and Install Skill(Автоматизация) — Поиск погодных навыков и корректная установка

  14. AI Image Generation(Смешанный) — Генерация и сохранение изображения по описанию

  15. Humanize AI-Generated Blog(Судья LLM) — Преобразование машинного контента в естественную разговорную речь

  16. Daily Research Summary(Судья LLM) — Синтез связного ежедневного резюме из нескольких документов

  17. Email Inbox Triage(Смешанный) — Анализ нескольких писем и составление отчета по степени срочности

  18. Email Search and Summarization(Смешанный) — Поиск в архиве писем и извлечение ключевой информации

  19. Competitive Market Research(Смешанный) — Анализ конкурентов в области корпоративных APM

  20. CSV and Excel Summarization(Смешанный) — Анализ табличных файлов и вывод инсайтов

  21. ELI5 PDF Summarization(Судья LLM) — Объяснение технического PDF-файла языком, понятным 5-летнему ребенку

  22. OpenClaw Report Comprehension(Автоматизация) — Точный ответ на конкретные вопросы из PDF-отчета исследования

  23. Second Brain Knowledge Persistence(Смешанный) — Межсессионное хранение и точное воспроизведение информации

IV. Ключевой вывод: Рейтинг Топ-10 больших моделей по успешности (Лучший %/Средний %)

  • Данные обновлены по состоянию на 7 апреля 2026 года

  • Лучший % — наивысшая единичная успешность, Средний % — средняя успешность за несколько попыток, лучше отражает стабильность

以下是成功率最高的前十模型

  1. anthropic/claude-opus-4.6(Anthropic) — 93.3% / 82.0%

  2. arcee-ai/trinity-large-thinking(Arcee AI) — 91.9% / 91.9%

  3. openai/gpt-5.4(OpenAI) — 90.5% / 81.7%

  4. qwen/qwen3.5-27b(Qwen) — 90.0% / 78.5%

  5. minimax/minimax-m2.7(MiniMax) — 89.8% / 83.2%

  6. anthropic/claude-haiku-4.5(Anthropic) — 89.5% / 78.1%

  7. qwen/qwen3.5-397b-a17b(Qwen) — 89.1% / 80.4%

  8. xiaomi/mimo-v2-flash(Xiaomi) — 88.8% / 70.2%

  9. qwen/qwen3.6-plus-preview(Qwen) — 88.6% / 84.0%

  10. nvidia/nemotron-3-super-120b-a12b(NVIDIA) — 88.6% / 75.5%

Claude Opus 4.6 в настоящее время лидирует с наивысшей успешностью 93.3%, но Trinity от Arcee демонстрирует впечатляющие результаты по средней стабильности. Серия Qwen также имеет несколько моделей в топ-10, показывая большой потенциал с точки зрения соотношения цены и качества. Успешность — это базовый порог, последующие измерения скорости и стоимости будут further влиять на фактический опыт.

Этот бенчмарк из 23 задач полностью прозрачен, настоятельно рекомендуем протестировать его в соответствии с вашими сценариями. Больше рейтингов других моделей ждите в即将推出的 функции рейтинга агентов от MyToken.

(Данные来源于открытого бенчмарка тестирования агентов OpenClaw от PinchBench, постоянно обновляются.)

Связанные с этим вопросы

QКакой показатель является основным критерием оценки в тестировании OpenClaw агентов?

AОсновным критерием оценки является процент успешного выполнения (Success Rate) — доля задач, которые агент смог выполнить полностью и точно.

QКакие три метода оценки использовались в тестировании?

AИспользовались три метода: автоматизированная проверка скриптами, оценка моделью ИИ-судьей (Claude Opus) и гибридный режим, сочетающий автоматическую проверку и качественную оценку ИИ.

QКакая модель показала наивысший максимальный процент успеха (Best %)?

AМодель anthropic/claude-opus-4.6 (от Anthropic) показала наивысший максимальный процент успеха — 93.3%.

QКакая модель продемонстрировала наилучшую стабильность результатов (самый высокий средний процент успеха Avg %)?

AМодель arcee-ai/trinity-large-thinking (от Arcee AI) продемонстрировала наилучшую стабильность с самым высоким средним процентом успеха — 91.9%.

QСколько всего задач было включено в бенчмарк для тестирования?

AВ бенчмарк было включено 23 задачи, охватывающих различные аспекты: базовое взаимодействие, работу с файлами и кодом, создание контента, исследования, системные вызовы и сохранение памяти.

Похожее

Дивиденды по привилегированным акциям STRC остаются на уровне 12% несмотря на цену ниже номинала

Хотя привилегированные акции STRC компании Strategy завершили июль значительно ниже номинальной стоимости в $100, инвесторам сообщили, что дивиденд за август останется на уровне 12% и не будет увеличен. Акции закрылись 2 августа на уровне $89.46. Генеральный директор Фонг Ле подтвердил, что корпоративная цель — достичь торговли акциями в диапазоне $99-$100, но не уточнил сроки. В июле компания сообщила о чистом убытке в $8.22 млрд за второй квартал, в основном из-за нереализованных потерь на хранении биткоина. Для обеспечения выплат по привилегированным акциям Strategy создала денежный резерв в $3.75 млрд, которого хватит более чем на два года. Компания также выкупила часть своих привилегированных акций со скидкой и намерена продолжать покупки, пока они торгуются ниже номинала.

cointelegraph25 мин. назад

Дивиденды по привилегированным акциям STRC остаются на уровне 12% несмотря на цену ниже номинала

cointelegraph25 мин. назад

Вывод биткоинов продолжается: 8 лет хранения в холодном кошельке Coldcard закончились нулем

Аппаратный кошелек Coldcard оказался уязвимым, что привело к масштабному выводу средств. По данным Galaxy Research на 2 августа 2026 года, похищено уже более 1367 BTC (около $88.6 млн) с 4585 адресов. Проблема связана не с прошивкой, а с seed-фразами, сгенерированными на уязвимых устройствах в определенный период (Mk2/Mk3 с прошивкой 4.0.1–4.1.9; Mk4/Mk5 до версии 5.6.0; Q до версии 1.5.0Q). Причина — ошибка в интеграции библиотеки libNgU, из-за которой устройство перестало использовать аппаратный генератор случайных чисел, перейдя на предсказуемый программный. Обновление прошивки не меняет существующую seed-фразу, поэтому владельцам необходимо сгенерировать новую на исправленной версии и перевести активы. Статья приводит трагичный пример 39-летнего инвестора, который за 8 лет накопил 2 BTC тяжелым трудом, храня их в Coldcard как защиту от гиперинфляции в своей стране, но потерял все за минуты из-за этой уязвимости. Этот случай показывает, что даже стратегия холодного хранения не является абсолютно надежной, особенно когда уязвимость кроется в самом генераторе случайных чисел внутри изолированного устройства.

cryptonews.ru29 мин. назад

Вывод биткоинов продолжается: 8 лет хранения в холодном кошельке Coldcard закончились нулем

cryptonews.ru29 мин. назад

Паркер Льюис ответил, почему биткоин остаётся лучшими деньгами

Известный биткоин-аналитик Паркер Льюис раскритиковал стратегии публичных компаний, позиционирующих себя как криптовалютные казначейства. Он заявил, что продажа ими «цифрового кредита» в виде бессрочных привилегированных акций искажает суть биткоина, который не генерирует фиатный доход на алгоритмическом уровне. Льюис подчеркнул, что выплата дивидендов в этой модели часто зависит от притока новых инвесторов, что несёт высокие риски, наглядно демонстрируемые скромным размером рынка таких акций ($1 трлн) на фоне глобального кредитного рынка ($300 трлн). Эксперт также опроверг тезис о чрезмерной волатильности биткоина, объяснив её как естественное следствие массового принятия актива с жёстко ограниченным предложением. Он призвал инвесторов покупать биткоины напрямую, а не акции компаний вроде MicroStrategy, что математически безопаснее. Льюис указал на главную угрозу — инфляцию фиатных денег, проиллюстрировав её личным «Индексом рибая», показывающим рост цен на 12–13% годовых. В итоге, наиболее надёжной стратегией защиты сбережений он назвал прямое владение биткоином и контроль над приватными ключами, предостерегая от скрытых рисков погони за корпоративной доходностью через деривативы.

cryptonews.ru4 ч. назад

Паркер Льюис ответил, почему биткоин остаётся лучшими деньгами

cryptonews.ru4 ч. назад

Торговля

Спот
活动图片