Кто действительно является сильнейшим агентом OpenClaw? Опубликован рейтинг из 23 реальных задач

marsbitОпубликовано 2026-04-08Обновлено 2026-04-08

Введение

Рейтинг лучших AI-агентов OpenClaw: опубликованы результаты тестирования 23 реальных задач. Платформа MyToken представила прозрачный бенчмарк, оценивающий способности моделей на основе успешного выполнения задач. Ключевой критерий — процент успеха (Success Rate). Тестирование включало 23 задачи: от создания событий в календаре и анализа акций до написания блогов и исследования рынка. Использовались три метода оценки: автоматизированная проверка, оценка моделью-судьёй (Claude Opus) и гибридный подход. Топ-10 моделей по успешности (Best % / Avg %): 1. anthropic/claude-opus-4.6 — 93.3% / 82.0% 2. arcee-ai/trinity-large-thinking — 91.9% / 91.9% 3. openai/gpt-5.4 — 90.5% / 81.7% 4. qwen/qwen3.5-27b — 90.0% / 78.5% 5. minimax/minimax-m2.7 — 89.8% / 83.2% Claude Opus показал наивысший результат, но Trinity от Arcee выделился стабильностью. Все методики и данные открыты для проверки.

Хотите узнать, какая большая языковая модель действительно сильнее всего в реальных задачах агента OpenClaw?

MyToken на основе сайта с тестами подготовил прозрачный бенчмарк, сфокусированный на оценке практических способностей ИИ-агентов для программирования, рассматривая только одно ключевое измерение — успешность (скорость и стоимость относятся к другим независимым измерениям, которые будут проанализированы отдельно позже). Полностью открытый, воспроизводимый, представляющий только строгие стандарты тестирования + актуальный Топ-10 рейтинг по успешности.

I. Измерение для оценки:Успешность

Конкретный стандарт: доля задач, которые ИИ-агент точно и полностью выполняет. Каждая задача использует высокостандартизированный процесс:

  • Точные пользовательские промпты (Prompt)

Отправляются агенту для имитации реальных сценариев пользовательских запросов

  • Ожидаемое поведение (Expected Behavior)

Указываются приемлемые способы реализации и ключевые моменты принятия решений

  • Критерии оценки (checklist)

Предоставляется атомизированный список критериев успеха для поэтапной проверки

II. Три метода оценки

В этом тестировании в основном используются 3 метода оценки:

  • Автоматическая проверка: Python-скрипты напрямую проверяют объективные результаты, такие как содержимое файлов, записи выполнения, вызовы инструментов

  • Судья LLM-модель: Claude Opus выставляет оценки по подробной шкале (качество контента, уместность, полнота и т.д.)

  • Смешанный режим: сочетание автоматической объективной проверки и качественной оценки судьей LLM

Все определения задач, промпты, логика оценки полностью открыты для повторного тестирования и проверки.

III. Задачи, используемые для оценки

Этот бенчмарк охватывает 23 задачи разных категорий. Охватывает множество измерений: базовое взаимодействие, операции с файлами/кодом, создание контента, исследовательский анализ, вызов системных инструментов, постоянство памяти и другие, что高度 соответствует повседневным сценариям использования OpenClaw разработчиками:

  1. Sanity Check(Автоматизация) — Обработка простых инструкций и корректный ответ на приветствие

  2. Calendar Event Creation(Автоматизация) — Генерация стандартного ICS-файла календаря на естественном языке

  3. Stock Price Research(Автоматизация) — Запрос актуальной цены акций и вывод отформатированного отчета

  4. Blog Post Writing(Судья LLM) — Написание структурированного Markdown-блога объемом около 500 слов

  5. Weather Script Creation(Автоматизация) — Написание Python-скрипта для погодного API с обработкой ошибок

  6. Document Summarization(Судья LLM) — 3-этапное сжатое изложение основных тем

  7. Tech Conference Research(Судья LLM) — Исследование и систематизация информации о 5 реальных tech-конференциях (название, дата, место, ссылка)

  8. Professional Email Drafting(Судья LLM) — Вежливый отказ от встречи с предложением альтернативы

  9. Memory Retrieval from Context(Автоматизация) — Точное извлечение дат, участников, технологического стека и т.д. из проектных заметок

  10. File Structure Creation(Автоматизация) — Автоматическое создание стандартной структуры проекта, README, .gitignore

  11. Multi-step API Workflow(Смешанный) — Чтение конфигурации → Написание скрипта вызова → Полная документация

  12. Install ClawdHub Skill(Автоматизация) — Установка из репозитория навыков и проверка работоспособности

  13. Search and Install Skill(Автоматизация) — Поиск погодных навыков и корректная установка

  14. AI Image Generation(Смешанный) — Генерация и сохранение изображения по описанию

  15. Humanize AI-Generated Blog(Судья LLM) — Преобразование машинного контента в естественную разговорную речь

  16. Daily Research Summary(Судья LLM) — Синтез связного ежедневного резюме из нескольких документов

  17. Email Inbox Triage(Смешанный) — Анализ нескольких писем и составление отчета по степени срочности

  18. Email Search and Summarization(Смешанный) — Поиск в архиве писем и извлечение ключевой информации

  19. Competitive Market Research(Смешанный) — Анализ конкурентов в области корпоративных APM

  20. CSV and Excel Summarization(Смешанный) — Анализ табличных файлов и вывод инсайтов

  21. ELI5 PDF Summarization(Судья LLM) — Объяснение технического PDF-файла языком, понятным 5-летнему ребенку

  22. OpenClaw Report Comprehension(Автоматизация) — Точный ответ на конкретные вопросы из PDF-отчета исследования

  23. Second Brain Knowledge Persistence(Смешанный) — Межсессионное хранение и точное воспроизведение информации

IV. Ключевой вывод: Рейтинг Топ-10 больших моделей по успешности (Лучший %/Средний %)

  • Данные обновлены по состоянию на 7 апреля 2026 года

  • Лучший % — наивысшая единичная успешность, Средний % — средняя успешность за несколько попыток, лучше отражает стабильность

以下是成功率最高的前十模型

  1. anthropic/claude-opus-4.6(Anthropic) — 93.3% / 82.0%

  2. arcee-ai/trinity-large-thinking(Arcee AI) — 91.9% / 91.9%

  3. openai/gpt-5.4(OpenAI) — 90.5% / 81.7%

  4. qwen/qwen3.5-27b(Qwen) — 90.0% / 78.5%

  5. minimax/minimax-m2.7(MiniMax) — 89.8% / 83.2%

  6. anthropic/claude-haiku-4.5(Anthropic) — 89.5% / 78.1%

  7. qwen/qwen3.5-397b-a17b(Qwen) — 89.1% / 80.4%

  8. xiaomi/mimo-v2-flash(Xiaomi) — 88.8% / 70.2%

  9. qwen/qwen3.6-plus-preview(Qwen) — 88.6% / 84.0%

  10. nvidia/nemotron-3-super-120b-a12b(NVIDIA) — 88.6% / 75.5%

Claude Opus 4.6 в настоящее время лидирует с наивысшей успешностью 93.3%, но Trinity от Arcee демонстрирует впечатляющие результаты по средней стабильности. Серия Qwen также имеет несколько моделей в топ-10, показывая большой потенциал с точки зрения соотношения цены и качества. Успешность — это базовый порог, последующие измерения скорости и стоимости будут further влиять на фактический опыт.

Этот бенчмарк из 23 задач полностью прозрачен, настоятельно рекомендуем протестировать его в соответствии с вашими сценариями. Больше рейтингов других моделей ждите в即将推出的 функции рейтинга агентов от MyToken.

(Данные来源于открытого бенчмарка тестирования агентов OpenClaw от PinchBench, постоянно обновляются.)

Связанные с этим вопросы

QКакой показатель является основным критерием оценки в тестировании OpenClaw агентов?

AОсновным критерием оценки является процент успешного выполнения (Success Rate) — доля задач, которые агент смог выполнить полностью и точно.

QКакие три метода оценки использовались в тестировании?

AИспользовались три метода: автоматизированная проверка скриптами, оценка моделью ИИ-судьей (Claude Opus) и гибридный режим, сочетающий автоматическую проверку и качественную оценку ИИ.

QКакая модель показала наивысший максимальный процент успеха (Best %)?

AМодель anthropic/claude-opus-4.6 (от Anthropic) показала наивысший максимальный процент успеха — 93.3%.

QКакая модель продемонстрировала наилучшую стабильность результатов (самый высокий средний процент успеха Avg %)?

AМодель arcee-ai/trinity-large-thinking (от Arcee AI) продемонстрировала наилучшую стабильность с самым высоким средним процентом успеха — 91.9%.

QСколько всего задач было включено в бенчмарк для тестирования?

AВ бенчмарк было включено 23 задачи, охватывающих различные аспекты: базовое взаимодействие, работу с файлами и кодом, создание контента, исследования, системные вызовы и сохранение памяти.

Похожее

Trump Media продаёт ещё 2628 BTC, запасы снижаются до 4261 BTC

Компания Trump Media & Technology Group (TMTG), стоящая за социальной сетью Truth Social, продолжает сокращать свои вложения в Bitcoin. По данным аналитической платформы Lookonchain, компания продала ещё 2628 BTC на сумму около 165 миллионов долларов через платформу Crypto.com. Это продолжение серии продаж, начавшихся семь месяцев назад. Всего за этот период TMTG продала 7281 BTC на общую сумму примерно 545 миллионов долларов по средней цене 74 855 долларов за монету. Первоначально компания приобрела 11542 BTC по средней цене 118 522 доллара. После последних транзакций её резервы сократились до 4261 BTC (около 269,8 миллиона долларов), что на 63% меньше изначальных холдингов. Эти продажи происходят на фоне усиленного внимания законодателей к криптовалютным интересам, связанным с Дональдом Трампом. В Конгрессе идут дебаты по закону CLARITY Act, который касается этических норм, владения цифровыми активами и потенциальных конфликтов интересов государственных лиц. Критики указывают на такие проекты, как мемкойны TRUMP и MELANIA, а также на токены World Liberty Financial, связывая политическое влияние с частными криптоинтересами.

cointelegraph22 мин. назад

Trump Media продаёт ещё 2628 BTC, запасы снижаются до 4261 BTC

cointelegraph22 мин. назад

Фуцзянь, Цзиньцзян: супер-единорог в сфере памяти тихо делает своё дело

В провинции Фуцзянь в городе Цзиньцзян, известном производством спортивной обуви, находится перспективная компания в области производства чипов памяти — Fujian Jinhua Integrated Circuit Co. (Jinhua). Основанная в 2016 году как часть национального плана по развитию полупроводниковой промышленности, компания столкнулась с серьёзными вызовами. В 2018 году она была внесена в санкционный список Министерства торговли США по обвинению в промышленном шпионаже в пользу американской компании Micron, что привело к остановке производственной линии. После пяти лет судебных разбирательств в феврале 2024 года федеральный суд в Сан-Франциско полностью оправдал Jinhua, сняв все обвинения. Несмотря на правовую победу, компания всё ещё остаётся в санкционном списке, а годы задержек серьёзно замедлили её развитие. Под руководством своего ключевого инженера Чэнь Чжэнкуня, известного как «мастер эффективности», компания сумела адаптировать производство, увеличив долю отечественного оборудования. В отличие от ChangXin Memory Technologies (CXMT) и Yangtze Memory Technologies (YMTC), которые продвинулись дальше в производстве DRAM и NAND-памяти соответственно, Jinhua сосредоточена на специализированной (нишевой) DRAM-памяти для потребительской электроники. Её текущая производственная мощность составляет около 40 000 пластин в месяц. Хотя её доход в 2023 году оценивался примерно в 2 млрд юаней, что значительно меньше, чем у конкурентов, компания остаётся важным игроком. История Jinhua тесно связана с амбициозной промышленной трансформацией города Цзиньцзян. Местные власти оказали компании полную поддержку, включая финансовые гарантии и создание кластера, что демонстрирует стратегическую важность проекта для региона. Несмотря на то, что Jinhua упустила первые годы бума на рынке памяти, её устойчивость в условиях санкций показывает потенциал для восстановления в новом цикле роста, движимом развитием искусственного интеллекта.

marsbit1 ч. назад

Фуцзянь, Цзиньцзян: супер-единорог в сфере памяти тихо делает своё дело

marsbit1 ч. назад

Почему биткойн-фермы внезапно стали новым входом для вычислительных мощностей ИИ на фоне дефицита электроэнергии в 38 ГВт?

Заголовок: Почему майнинговые фермы для биткоина внезапно стали новым входом для вычислительных мощностей ИИ на фоне дефицита электроэнергии в 38 ГВт? Краткое содержание: Когда конкуренция между центрами обработки данных ИИ сместилась с вопроса «кто купит больше GPU» к «кто раньше получит электроэнергию», некоторые майнинговые фермы для биткоина, ранее считавшиеся волатильными активами, начали трансформироваться в центры обработки данных для облачных провайдеров, используя свои готовые возможности подключения к сети, землю и трансформаторные подстанции. По расчетам Morgan Stanley, в период 2026-2028 годов в США может возникнуть дефицит электроэнергии для ЦОДов около 38 ГВт, и модернизация старых майнинговых ферм может обеспечить от 10 до 19 ГВт. Такие компании, как TeraWulf и Hut 8, переориентируются с добычи криптовалют на предоставление инфраструктуры («Powered Shell Provider»), предлагая клиентам из сферы ИИ критически важный ресурс — возможность быстрее конкурентов развернуть значительные вычислительные мощности. Ключевой ценностью становится не вычислительная мощность для майнинга, а дефицитный доступ к электросетям, получение которого «с нуля» в некоторых регионах США теперь может занять 5-7 лет.

华尔街日报1 ч. назад

Почему биткойн-фермы внезапно стали новым входом для вычислительных мощностей ИИ на фоне дефицита электроэнергии в 38 ГВт?

华尔街日报1 ч. назад

Майкл Сэйлор: «Мы никогда не говорили, что никогда не будем продавать биткоины»

Председатель стратегической комиссии Майкл Сэйлор прокомментировал сообщения о новом разрешении компании Strategy на продажу биткоинов. Он заявил, что данное разрешение не является новым — оно было объявлено ещё 29 июня в рамках системы управления капиталом компании. Соглашение позволяет продавать BTC на сумму до 5 миллиардов долларов для определённых целей, но не обязывает компанию к продаже. Сэйлор подчеркнул, что Strategy никогда официально не брала на себя обязательство никогда не продавать свои биткоины, хотя и рассчитывает оставаться чистым покупателем BTC в долгосрочной перспективе. Он назвал текущие новости «старыми», переподанными как новые, и подтвердил, что программа монетизации биткоинов компании не предполагает обязательной продажи её активов.

cryptonews.ru2 ч. назад

Майкл Сэйлор: «Мы никогда не говорили, что никогда не будем продавать биткоины»

cryptonews.ru2 ч. назад

«Летняя пила» продолжается: пробой $67 000 станет началом роста биткоина

Цена биткоина продолжает консолидироваться в диапазоне $58 000–$67 000 с начала июня. 1 августа актив снизился до $62 217. Аналитики расходятся в краткосрочных прогнозах: некоторые, как Crypto Candy, ожидают тестирования уровня $60 000 или ниже, пока цена находится под $66 000. Другие, как Jelle, видят в боковом движении «летнюю пилу» и придерживаются стратегии усреднения. Ключевым для определения дальнейшего направления считается уровень $67 000. По мнению Daan Crypto Trades, его пробой необходим для выхода из затянувшейся паузы. Roman полагает, что уверенный пробой с объемом может быстро запустить рост к $70 000–$80 000 и выше. С долгосрочной точки зрения, макроаналитик Герт ван Лаген рассматривает текущую фазу как накопление в рамках масштабной формации «чаша с ручкой». Он отмечает, что долгосрочные держатели не спешат продавать актив, о чем говорит показатель NUPL. Таким образом, рынок находится в решающей фазе, где пробой либо поддержки $60 000, либо сопротивления $67 000 задаст тренд на ближайшее будущее.

cryptonews.ru2 ч. назад

«Летняя пила» продолжается: пробой $67 000 станет началом роста биткоина

cryptonews.ru2 ч. назад

Торговля

Спот
活动图片