Кто действительно является сильнейшим агентом OpenClaw? Опубликован рейтинг из 23 реальных задач

marsbitОпубликовано 2026-04-08Обновлено 2026-04-08

Введение

Рейтинг лучших AI-агентов OpenClaw: опубликованы результаты тестирования 23 реальных задач. Платформа MyToken представила прозрачный бенчмарк, оценивающий способности моделей на основе успешного выполнения задач. Ключевой критерий — процент успеха (Success Rate). Тестирование включало 23 задачи: от создания событий в календаре и анализа акций до написания блогов и исследования рынка. Использовались три метода оценки: автоматизированная проверка, оценка моделью-судьёй (Claude Opus) и гибридный подход. Топ-10 моделей по успешности (Best % / Avg %): 1. anthropic/claude-opus-4.6 — 93.3% / 82.0% 2. arcee-ai/trinity-large-thinking — 91.9% / 91.9% 3. openai/gpt-5.4 — 90.5% / 81.7% 4. qwen/qwen3.5-27b — 90.0% / 78.5% 5. minimax/minimax-m2.7 — 89.8% / 83.2% Claude Opus показал наивысший результат, но Trinity от Arcee выделился стабильностью. Все методики и данные открыты для проверки.

Хотите узнать, какая большая языковая модель действительно сильнее всего в реальных задачах агента OpenClaw?

MyToken на основе сайта с тестами подготовил прозрачный бенчмарк, сфокусированный на оценке практических способностей ИИ-агентов для программирования, рассматривая только одно ключевое измерение — успешность (скорость и стоимость относятся к другим независимым измерениям, которые будут проанализированы отдельно позже). Полностью открытый, воспроизводимый, представляющий только строгие стандарты тестирования + актуальный Топ-10 рейтинг по успешности.

I. Измерение для оценки:Успешность

Конкретный стандарт: доля задач, которые ИИ-агент точно и полностью выполняет. Каждая задача использует высокостандартизированный процесс:

  • Точные пользовательские промпты (Prompt)

Отправляются агенту для имитации реальных сценариев пользовательских запросов

  • Ожидаемое поведение (Expected Behavior)

Указываются приемлемые способы реализации и ключевые моменты принятия решений

  • Критерии оценки (checklist)

Предоставляется атомизированный список критериев успеха для поэтапной проверки

II. Три метода оценки

В этом тестировании в основном используются 3 метода оценки:

  • Автоматическая проверка: Python-скрипты напрямую проверяют объективные результаты, такие как содержимое файлов, записи выполнения, вызовы инструментов

  • Судья LLM-модель: Claude Opus выставляет оценки по подробной шкале (качество контента, уместность, полнота и т.д.)

  • Смешанный режим: сочетание автоматической объективной проверки и качественной оценки судьей LLM

Все определения задач, промпты, логика оценки полностью открыты для повторного тестирования и проверки.

III. Задачи, используемые для оценки

Этот бенчмарк охватывает 23 задачи разных категорий. Охватывает множество измерений: базовое взаимодействие, операции с файлами/кодом, создание контента, исследовательский анализ, вызов системных инструментов, постоянство памяти и другие, что高度 соответствует повседневным сценариям использования OpenClaw разработчиками:

  1. Sanity Check(Автоматизация) — Обработка простых инструкций и корректный ответ на приветствие

  2. Calendar Event Creation(Автоматизация) — Генерация стандартного ICS-файла календаря на естественном языке

  3. Stock Price Research(Автоматизация) — Запрос актуальной цены акций и вывод отформатированного отчета

  4. Blog Post Writing(Судья LLM) — Написание структурированного Markdown-блога объемом около 500 слов

  5. Weather Script Creation(Автоматизация) — Написание Python-скрипта для погодного API с обработкой ошибок

  6. Document Summarization(Судья LLM) — 3-этапное сжатое изложение основных тем

  7. Tech Conference Research(Судья LLM) — Исследование и систематизация информации о 5 реальных tech-конференциях (название, дата, место, ссылка)

  8. Professional Email Drafting(Судья LLM) — Вежливый отказ от встречи с предложением альтернативы

  9. Memory Retrieval from Context(Автоматизация) — Точное извлечение дат, участников, технологического стека и т.д. из проектных заметок

  10. File Structure Creation(Автоматизация) — Автоматическое создание стандартной структуры проекта, README, .gitignore

  11. Multi-step API Workflow(Смешанный) — Чтение конфигурации → Написание скрипта вызова → Полная документация

  12. Install ClawdHub Skill(Автоматизация) — Установка из репозитория навыков и проверка работоспособности

  13. Search and Install Skill(Автоматизация) — Поиск погодных навыков и корректная установка

  14. AI Image Generation(Смешанный) — Генерация и сохранение изображения по описанию

  15. Humanize AI-Generated Blog(Судья LLM) — Преобразование машинного контента в естественную разговорную речь

  16. Daily Research Summary(Судья LLM) — Синтез связного ежедневного резюме из нескольких документов

  17. Email Inbox Triage(Смешанный) — Анализ нескольких писем и составление отчета по степени срочности

  18. Email Search and Summarization(Смешанный) — Поиск в архиве писем и извлечение ключевой информации

  19. Competitive Market Research(Смешанный) — Анализ конкурентов в области корпоративных APM

  20. CSV and Excel Summarization(Смешанный) — Анализ табличных файлов и вывод инсайтов

  21. ELI5 PDF Summarization(Судья LLM) — Объяснение технического PDF-файла языком, понятным 5-летнему ребенку

  22. OpenClaw Report Comprehension(Автоматизация) — Точный ответ на конкретные вопросы из PDF-отчета исследования

  23. Second Brain Knowledge Persistence(Смешанный) — Межсессионное хранение и точное воспроизведение информации

IV. Ключевой вывод: Рейтинг Топ-10 больших моделей по успешности (Лучший %/Средний %)

  • Данные обновлены по состоянию на 7 апреля 2026 года

  • Лучший % — наивысшая единичная успешность, Средний % — средняя успешность за несколько попыток, лучше отражает стабильность

以下是成功率最高的前十模型

  1. anthropic/claude-opus-4.6(Anthropic) — 93.3% / 82.0%

  2. arcee-ai/trinity-large-thinking(Arcee AI) — 91.9% / 91.9%

  3. openai/gpt-5.4(OpenAI) — 90.5% / 81.7%

  4. qwen/qwen3.5-27b(Qwen) — 90.0% / 78.5%

  5. minimax/minimax-m2.7(MiniMax) — 89.8% / 83.2%

  6. anthropic/claude-haiku-4.5(Anthropic) — 89.5% / 78.1%

  7. qwen/qwen3.5-397b-a17b(Qwen) — 89.1% / 80.4%

  8. xiaomi/mimo-v2-flash(Xiaomi) — 88.8% / 70.2%

  9. qwen/qwen3.6-plus-preview(Qwen) — 88.6% / 84.0%

  10. nvidia/nemotron-3-super-120b-a12b(NVIDIA) — 88.6% / 75.5%

Claude Opus 4.6 в настоящее время лидирует с наивысшей успешностью 93.3%, но Trinity от Arcee демонстрирует впечатляющие результаты по средней стабильности. Серия Qwen также имеет несколько моделей в топ-10, показывая большой потенциал с точки зрения соотношения цены и качества. Успешность — это базовый порог, последующие измерения скорости и стоимости будут further влиять на фактический опыт.

Этот бенчмарк из 23 задач полностью прозрачен, настоятельно рекомендуем протестировать его в соответствии с вашими сценариями. Больше рейтингов других моделей ждите в即将推出的 функции рейтинга агентов от MyToken.

(Данные来源于открытого бенчмарка тестирования агентов OpenClaw от PinchBench, постоянно обновляются.)

Связанные с этим вопросы

QКакой показатель является основным критерием оценки в тестировании OpenClaw агентов?

AОсновным критерием оценки является процент успешного выполнения (Success Rate) — доля задач, которые агент смог выполнить полностью и точно.

QКакие три метода оценки использовались в тестировании?

AИспользовались три метода: автоматизированная проверка скриптами, оценка моделью ИИ-судьей (Claude Opus) и гибридный режим, сочетающий автоматическую проверку и качественную оценку ИИ.

QКакая модель показала наивысший максимальный процент успеха (Best %)?

AМодель anthropic/claude-opus-4.6 (от Anthropic) показала наивысший максимальный процент успеха — 93.3%.

QКакая модель продемонстрировала наилучшую стабильность результатов (самый высокий средний процент успеха Avg %)?

AМодель arcee-ai/trinity-large-thinking (от Arcee AI) продемонстрировала наилучшую стабильность с самым высоким средним процентом успеха — 91.9%.

QСколько всего задач было включено в бенчмарк для тестирования?

AВ бенчмарк было включено 23 задачи, охватывающих различные аспекты: базовое взаимодействие, работу с файлами и кодом, создание контента, исследования, системные вызовы и сохранение памяти.

Похожее

ПОСЛЕДНИЕ НОВОСТИ: Дональд Трамп сделал резкое заявление по поводу Ирана! Он остановил атаки

Президент США Дональд Трамп заявил о приостановке запланированных масштабных военных действий против Ирана. Это решение было принято после обращения к нему Саудовской Аравии, ОАЭ, Катара и самого Ирана с просьбой предоставить время для дипломатических переговоров. Союзники в регионе полагают, что соглашение близко. Первоначальный этап переговоров будет сосредоточен на вопросах безопасности и возобновлении нормальной работы Ормузского пролива — ключевого маршрута для мировой нефтеторговли, чья безопасность критически важна для глобальных цен на энергоносители. После решения этих вопросов планируется начать переговоры по иранской ядерной программе. Новый раунд переговоров с Ираном начнётся завтра. В своём выступлении Трамп также коснулся темы валютного рынка, заявив, что США вмешались в поддержку японской иены, подчеркнув крепкие союзнические и взаимовыгодные экономические отношения с Японией.

cryptonews.ru43 мин. назад

ПОСЛЕДНИЕ НОВОСТИ: Дональд Трамп сделал резкое заявление по поводу Ирана! Он остановил атаки

cryptonews.ru43 мин. назад

Банк Италии не увидел системных преимуществ стейблкоинов в переводах

Исследование Банка Италии показало, что стейблкоины (на примере USDC) не демонстрируют устойчивых системных преимуществ в стоимости и скорости международных денежных переводов по сравнению с традиционными сервисами. Анализ транзакций на 200 USDC в 10 платежных коридорах (Италия — Бразилия, Аргентина, Япония, ОАЭ, ЮАР и др.) выявил, что финальная стоимость переводов варьировалась от 0,3% до почти 9%. Сроки исполнения колебались от менее 20 минут в коридорах с инфраструктурой мгновенных платежей до 1-2 рабочих дней в ее отсутствие. Ключевые издержки и задержки связаны не с комиссиями блокчейна, а с процессами конвертации в фиатные валюты и работой локальных платежных систем. Хотя в большинстве изучных направлений стоимость переводов со стейблкоинами была ниже среднемирового показателя в 6,65%, по сравнению с сервисом Wise преимущество наблюдалось только в трех из семи сопоставимых случаев. Авторы отмечают, что преимущества стейблкоинов могли бы быть более заметны, если бы их можно было напрямую тратить без конвертации. Также подчеркивается, что запретительное регулирование не устраняет спрос на стейблкоины, а излишне жесткие правила лишь усложняют их использование для розничных клиентов. В контексте исследования упоминается значительное снижение общей капитализации рынка стейблкоинов в июле.

cryptonews.ru1 ч. назад

Банк Италии не увидел системных преимуществ стейблкоинов в переводах

cryptonews.ru1 ч. назад

«Биткойн-бум» в разгаре: новое заявление Сэйлора вызвало спекуляции о покупках

Исполнительный председатель MicroStrategy Майкл Сэйлор 2 августа опубликовал сообщение «Bitcoin Drive engaged», что вызвало спекуляции о новой покупке биткойнов компанией. Его отчет показал, что резерв MicroStrategy составляет 843 775 BTC стоимостью около $53,25 млрд, со средней себестоимостью $75 653 и нереализованным убытком в $10,58 млрд. Ранее аналогичный сигнал предшествовал объявлению о пополнении долларового резерва. В то же время, реестр компании отразил две недавние продажи на общую сумму 3 588 BTC, сократив запасы. Эти продажи, согласно документам SEC, были проведены для финансирования выплат по привилегированным акциям. Неделей ранее компания не покупала биткойны, увеличив свой долларовый резерв примерно до $3,75 млрд. Финансовые риски остаются высокими после отчетности об операционном убытке в $8,33 млрд за второй квартал 2026 года. Ожидается, что обновление данных в понедельник покажет, означает ли сообщение Сэйлора возврат к накоплению биткойнов, поскольку компания балансирует между своими крупными запасами криптовалюты и растущими денежными обязательствами.

cryptonews.ru1 ч. назад

«Биткойн-бум» в разгаре: новое заявление Сэйлора вызвало спекуляции о покупках

cryptonews.ru1 ч. назад

Паттерн на графике биткоина «голоса и плечи» сулит подъём к $67,200

Несмотря на медленное снижение в начале августа, на графике биткоина формируется перевёрнутая разворотная модель «голова и плечи». Цена $BTC колеблется около $63,200, формируя правое плечо, что является основным поводом для краткосрочного оптимизма. Ключевой вопрос — хватит ли покупателям сил для рывка к уровню $67,200 для подтверждения разворота. В то же время в паре ETH/BTC уже пробито разворотное дно. Ethereum демонстрирует относительную силу, закрепился в восходящем тренде и движется к цели 0,0312, а против доллара тестирует уровень $1875, открывая путь к $2163. Эта ротация капитала в пользу ETH лишает биткоин объёма, необходимого для быстрого роста. Таким образом, ситуация для биткоина остаётся напряжённой: либо он в ближайшие дни последует примеру Ethereum и осуществит быстрый рост выше $67,200, либо, если атака на «шею» паттерна не состоится, медведи возьмут контроль и отправят цену к уровням поддержки $60,000 и $58,000.

cryptonews.ru1 ч. назад

Паттерн на графике биткоина «голоса и плечи» сулит подъём к $67,200

cryptonews.ru1 ч. назад

Акции компаний, занимающихся искусственным интеллектом, торгуются как «мемокоины», в то время как биткоин практически не меняет цены — обзор недели

В еженедельном обзоре рассматривается волатильность на рынках, вызванная распродажей в секторе ИИ и проблемами крупного хедж-фонда «Situational Awareness», что привело к значительным падениям на азиатских фондовых рынках. Акцентируется внимание на макроэкономических факторах, включая политику ФРС и интервенции Банка Японии. В криптосфере обсуждаются закрытие бирж BitMart и банкротство Storj Labs, трудности компаний вроде Coinbase, а также действия MicroStrategy по наращиванию резервов. Поднимаются темы инсайдерской торговли на Hyperliquid и отключения малопопулярных активов в Aave. Отдельно выделяется энтузиазм венчурных инвесторов вокруг Bittensor ($TAO). Завершается обзор серьёзным предупреждением об уязвимости аппаратных кошельков Coldcard, призывая пользователей к немедленным действиям и повышенной бдительности при самохранении активов.

cryptonews.ru1 ч. назад

Акции компаний, занимающихся искусственным интеллектом, торгуются как «мемокоины», в то время как биткоин практически не меняет цены — обзор недели

cryptonews.ru1 ч. назад

Торговля

Спот
活动图片