Кто действительно является сильнейшим агентом OpenClaw? Опубликован рейтинг из 23 реальных задач

marsbitОпубликовано 2026-04-08Обновлено 2026-04-08

Введение

Рейтинг лучших AI-агентов OpenClaw: опубликованы результаты тестирования 23 реальных задач. Платформа MyToken представила прозрачный бенчмарк, оценивающий способности моделей на основе успешного выполнения задач. Ключевой критерий — процент успеха (Success Rate). Тестирование включало 23 задачи: от создания событий в календаре и анализа акций до написания блогов и исследования рынка. Использовались три метода оценки: автоматизированная проверка, оценка моделью-судьёй (Claude Opus) и гибридный подход. Топ-10 моделей по успешности (Best % / Avg %): 1. anthropic/claude-opus-4.6 — 93.3% / 82.0% 2. arcee-ai/trinity-large-thinking — 91.9% / 91.9% 3. openai/gpt-5.4 — 90.5% / 81.7% 4. qwen/qwen3.5-27b — 90.0% / 78.5% 5. minimax/minimax-m2.7 — 89.8% / 83.2% Claude Opus показал наивысший результат, но Trinity от Arcee выделился стабильностью. Все методики и данные открыты для проверки.

Хотите узнать, какая большая языковая модель действительно сильнее всего в реальных задачах агента OpenClaw?

MyToken на основе сайта с тестами подготовил прозрачный бенчмарк, сфокусированный на оценке практических способностей ИИ-агентов для программирования, рассматривая только одно ключевое измерение — успешность (скорость и стоимость относятся к другим независимым измерениям, которые будут проанализированы отдельно позже). Полностью открытый, воспроизводимый, представляющий только строгие стандарты тестирования + актуальный Топ-10 рейтинг по успешности.

I. Измерение для оценки:Успешность

Конкретный стандарт: доля задач, которые ИИ-агент точно и полностью выполняет. Каждая задача использует высокостандартизированный процесс:

  • Точные пользовательские промпты (Prompt)

Отправляются агенту для имитации реальных сценариев пользовательских запросов

  • Ожидаемое поведение (Expected Behavior)

Указываются приемлемые способы реализации и ключевые моменты принятия решений

  • Критерии оценки (checklist)

Предоставляется атомизированный список критериев успеха для поэтапной проверки

II. Три метода оценки

В этом тестировании в основном используются 3 метода оценки:

  • Автоматическая проверка: Python-скрипты напрямую проверяют объективные результаты, такие как содержимое файлов, записи выполнения, вызовы инструментов

  • Судья LLM-модель: Claude Opus выставляет оценки по подробной шкале (качество контента, уместность, полнота и т.д.)

  • Смешанный режим: сочетание автоматической объективной проверки и качественной оценки судьей LLM

Все определения задач, промпты, логика оценки полностью открыты для повторного тестирования и проверки.

III. Задачи, используемые для оценки

Этот бенчмарк охватывает 23 задачи разных категорий. Охватывает множество измерений: базовое взаимодействие, операции с файлами/кодом, создание контента, исследовательский анализ, вызов системных инструментов, постоянство памяти и другие, что高度 соответствует повседневным сценариям использования OpenClaw разработчиками:

  1. Sanity Check(Автоматизация) — Обработка простых инструкций и корректный ответ на приветствие

  2. Calendar Event Creation(Автоматизация) — Генерация стандартного ICS-файла календаря на естественном языке

  3. Stock Price Research(Автоматизация) — Запрос актуальной цены акций и вывод отформатированного отчета

  4. Blog Post Writing(Судья LLM) — Написание структурированного Markdown-блога объемом около 500 слов

  5. Weather Script Creation(Автоматизация) — Написание Python-скрипта для погодного API с обработкой ошибок

  6. Document Summarization(Судья LLM) — 3-этапное сжатое изложение основных тем

  7. Tech Conference Research(Судья LLM) — Исследование и систематизация информации о 5 реальных tech-конференциях (название, дата, место, ссылка)

  8. Professional Email Drafting(Судья LLM) — Вежливый отказ от встречи с предложением альтернативы

  9. Memory Retrieval from Context(Автоматизация) — Точное извлечение дат, участников, технологического стека и т.д. из проектных заметок

  10. File Structure Creation(Автоматизация) — Автоматическое создание стандартной структуры проекта, README, .gitignore

  11. Multi-step API Workflow(Смешанный) — Чтение конфигурации → Написание скрипта вызова → Полная документация

  12. Install ClawdHub Skill(Автоматизация) — Установка из репозитория навыков и проверка работоспособности

  13. Search and Install Skill(Автоматизация) — Поиск погодных навыков и корректная установка

  14. AI Image Generation(Смешанный) — Генерация и сохранение изображения по описанию

  15. Humanize AI-Generated Blog(Судья LLM) — Преобразование машинного контента в естественную разговорную речь

  16. Daily Research Summary(Судья LLM) — Синтез связного ежедневного резюме из нескольких документов

  17. Email Inbox Triage(Смешанный) — Анализ нескольких писем и составление отчета по степени срочности

  18. Email Search and Summarization(Смешанный) — Поиск в архиве писем и извлечение ключевой информации

  19. Competitive Market Research(Смешанный) — Анализ конкурентов в области корпоративных APM

  20. CSV and Excel Summarization(Смешанный) — Анализ табличных файлов и вывод инсайтов

  21. ELI5 PDF Summarization(Судья LLM) — Объяснение технического PDF-файла языком, понятным 5-летнему ребенку

  22. OpenClaw Report Comprehension(Автоматизация) — Точный ответ на конкретные вопросы из PDF-отчета исследования

  23. Second Brain Knowledge Persistence(Смешанный) — Межсессионное хранение и точное воспроизведение информации

IV. Ключевой вывод: Рейтинг Топ-10 больших моделей по успешности (Лучший %/Средний %)

  • Данные обновлены по состоянию на 7 апреля 2026 года

  • Лучший % — наивысшая единичная успешность, Средний % — средняя успешность за несколько попыток, лучше отражает стабильность

以下是成功率最高的前十模型

  1. anthropic/claude-opus-4.6(Anthropic) — 93.3% / 82.0%

  2. arcee-ai/trinity-large-thinking(Arcee AI) — 91.9% / 91.9%

  3. openai/gpt-5.4(OpenAI) — 90.5% / 81.7%

  4. qwen/qwen3.5-27b(Qwen) — 90.0% / 78.5%

  5. minimax/minimax-m2.7(MiniMax) — 89.8% / 83.2%

  6. anthropic/claude-haiku-4.5(Anthropic) — 89.5% / 78.1%

  7. qwen/qwen3.5-397b-a17b(Qwen) — 89.1% / 80.4%

  8. xiaomi/mimo-v2-flash(Xiaomi) — 88.8% / 70.2%

  9. qwen/qwen3.6-plus-preview(Qwen) — 88.6% / 84.0%

  10. nvidia/nemotron-3-super-120b-a12b(NVIDIA) — 88.6% / 75.5%

Claude Opus 4.6 в настоящее время лидирует с наивысшей успешностью 93.3%, но Trinity от Arcee демонстрирует впечатляющие результаты по средней стабильности. Серия Qwen также имеет несколько моделей в топ-10, показывая большой потенциал с точки зрения соотношения цены и качества. Успешность — это базовый порог, последующие измерения скорости и стоимости будут further влиять на фактический опыт.

Этот бенчмарк из 23 задач полностью прозрачен, настоятельно рекомендуем протестировать его в соответствии с вашими сценариями. Больше рейтингов других моделей ждите в即将推出的 функции рейтинга агентов от MyToken.

(Данные来源于открытого бенчмарка тестирования агентов OpenClaw от PinchBench, постоянно обновляются.)

Связанные с этим вопросы

QКакой показатель является основным критерием оценки в тестировании OpenClaw агентов?

AОсновным критерием оценки является процент успешного выполнения (Success Rate) — доля задач, которые агент смог выполнить полностью и точно.

QКакие три метода оценки использовались в тестировании?

AИспользовались три метода: автоматизированная проверка скриптами, оценка моделью ИИ-судьей (Claude Opus) и гибридный режим, сочетающий автоматическую проверку и качественную оценку ИИ.

QКакая модель показала наивысший максимальный процент успеха (Best %)?

AМодель anthropic/claude-opus-4.6 (от Anthropic) показала наивысший максимальный процент успеха — 93.3%.

QКакая модель продемонстрировала наилучшую стабильность результатов (самый высокий средний процент успеха Avg %)?

AМодель arcee-ai/trinity-large-thinking (от Arcee AI) продемонстрировала наилучшую стабильность с самым высоким средним процентом успеха — 91.9%.

QСколько всего задач было включено в бенчмарк для тестирования?

AВ бенчмарк было включено 23 задачи, охватывающих различные аспекты: базовое взаимодействие, работу с файлами и кодом, создание контента, исследования, системные вызовы и сохранение памяти.

Похожее

Майкл Сэйлор заявил, что стало невозможно принять обновление биткойна, против которого он выступал!

Майкл Сэйлор заявил, что обновление Bitcoin BIP-110 математически не сможет достичь требуемого порога в 55% добровольной поддержки майнеров в текущем цикле сложности. По его данным, из 946 блоков, сгенерированных к моменту блока 960 561, лишь в 24 был зафиксирован сигнал поддержки этого предложения, и все они исходили от майнеров DATUM через пул OCEAN. Сэйлор подчеркнул, что отсутствие сигналов от остальных майнеров означает, что текущий уровень поддержки не отражает консенсуса. BIP-110 предлагает ограничить возможность добавления в блокчейн Bitcoin данных, не связанных с денежными переводами (например, изображений или текста), чтобы предотвратить «засорение» сети. Сэйлор выступает против, считая, что сеть не должна решать, какие транзакции являются «нужными», а правила не могут меняться по воле небольшой группы. Он также утверждает, что высокая статистика поддержки может быть искусственно завышена из-за автоматизированного процесса сигнализации в некотором программном обеспечении.

cryptonews.ru34 мин. назад

Майкл Сэйлор заявил, что стало невозможно принять обновление биткойна, против которого он выступал!

cryptonews.ru34 мин. назад

В рамках стратегии дивидендная доходность STRC сохраняется на уровне 12%, поскольку цена акций остается ниже номинальной стоимости

Исполнительный председатель Strategy Майкл Сэйлор подтвердил, что дивидендная ставка по бессрочным привилегированным акциям STRC сохранится на уровне 12% до августа 2026 года. Механизм «трещотки» повышает ставку на 0,5%, когда цена падает ниже $95, но не может её понизить при восстановлении цены, что призвано поддерживать стоимость акций на уровне номинала в $100. Несмотря на рекордную дивидендную доходность, акции STRC продолжают торговаться со скидкой около 10-11% от номинала, закрывшись 31 июля на отметке $89.46. Конкуренция с продуктами вроде SATA (13% доходность) и волатильность биткоина усложняют задачу. Устойчивый дисконт вынудил Strategy приостановить выпуск новых акций STRC, ограничив один из каналов финансирования закупок биткоина. Аналитики и юристы высказывают опасения по поводу долгосрочных рисков структуры «трещотки» и способности компании поддерживать выплаты при падении цены биткоина. Strategy создала финансовые резервы, покрывающие около 26 месяцев обязательств, и утвердила программу выкупа акций и монетизации биткоинов для управления рисками.

cryptonews.ru36 мин. назад

В рамках стратегии дивидендная доходность STRC сохраняется на уровне 12%, поскольку цена акций остается ниже номинальной стоимости

cryptonews.ru36 мин. назад

Аналитик: В августе курс биткоина упадет до 60 тыс. долларов, а затем восстановится до 70 тыс. долларов

Аналитик Андрей Порошин (Bitbanker) прогнозирует динамику биткоина на август. Он ожидает, что криптовалютный рынок переживёт спад из-за отсутствия макроэкономических стимулов. Решение ФРС США сохранить процентные ставки не дало рынку чётких сигналов, оставив инвесторов в состоянии осторожности. По базовому сценарию, биткоин в августе может упасть до уровня $60 000 – $62 000, после чего восстановится до $70 000. Этот уровень всё ещё ниже себестоимости майнинга в США, что вынуждает некоторых майнеров переходить в бизнес ИИ-центров обработки данных. В качестве положительного катализатора аналитик отмечает уход со рынка слабых игроков, например, сворачивание деятельности BitMEX, что традиционно снижает краткосрочное давление на цену. Геополитические факторы (эскалация конфликта Иран-США) и неопределённость вокруг закона CLARITY, по его мнению, не окажут существенного влияния на рынок в августе. Более активные ценовые колебания Порошин ожидает в сентябре в связи с новыми решениями ФРС и возможным движением по закону CLARITY Act.

cryptonews.ru36 мин. назад

Аналитик: В августе курс биткоина упадет до 60 тыс. долларов, а затем восстановится до 70 тыс. долларов

cryptonews.ru36 мин. назад

В результате взлома Coldcard, одного из крупнейших взломов биткоин-кошельков за последнее время, началась новая волна убытков! Убытки растут

В результате взлома Coldcard, одного из крупнейших взломов биткоин-кошельков за последнее время, произошла третья волна атак. Исследовательская компания Galaxy Research сообщает, что из кошельков, созданных на этих устройствах, было выведено еще 207,73 BTC. Общие потери теперь составляют около 1367 BTC (примерно 88,6 млн долларов США) по 4585 адресам. Первые две волны атак демонстрировали схожие черты, что указывало на одного злоумышленника. Однако третья волна отличается по методам: используются отдельные адреса для каждой жертвы, адреса P2WSH вместо P2WPKH, и атака нацелена на стандартный путь генерации. Это может означать либо модификацию инструментов первоначальным взломщиком, либо появление нового. Похищенные биткоины, общая стоимость которых оценивается в 88,6 млн долларов, пока не были потрачены злоумышленниками. Анализ показывает, что потери в основном пришлись на кошельки с небольшим балансом, что характерно для индивидуальных пользователей, а не институциональных сервисов. Уязвимое ПО Coldcard было выпущено 17 марта 2021 года, и все украденные средства были созданы после этой даты.

cryptonews.ru1 ч. назад

В результате взлома Coldcard, одного из крупнейших взломов биткоин-кошельков за последнее время, началась новая волна убытков! Убытки растут

cryptonews.ru1 ч. назад

Trump Media продаёт ещё 2628 BTC, запасы снижаются до 4261 BTC

Компания Trump Media & Technology Group (TMTG), стоящая за социальной сетью Truth Social, продолжает сокращать свои вложения в Bitcoin. По данным аналитической платформы Lookonchain, компания продала ещё 2628 BTC на сумму около 165 миллионов долларов через платформу Crypto.com. Это продолжение серии продаж, начавшихся семь месяцев назад. Всего за этот период TMTG продала 7281 BTC на общую сумму примерно 545 миллионов долларов по средней цене 74 855 долларов за монету. Первоначально компания приобрела 11542 BTC по средней цене 118 522 доллара. После последних транзакций её резервы сократились до 4261 BTC (около 269,8 миллиона долларов), что на 63% меньше изначальных холдингов. Эти продажи происходят на фоне усиленного внимания законодателей к криптовалютным интересам, связанным с Дональдом Трампом. В Конгрессе идут дебаты по закону CLARITY Act, который касается этических норм, владения цифровыми активами и потенциальных конфликтов интересов государственных лиц. Критики указывают на такие проекты, как мемкойны TRUMP и MELANIA, а также на токены World Liberty Financial, связывая политическое влияние с частными криптоинтересами.

cointelegraph2 ч. назад

Trump Media продаёт ещё 2628 BTC, запасы снижаются до 4261 BTC

cointelegraph2 ч. назад

Торговля

Спот
活动图片