Кто действительно является сильнейшим агентом OpenClaw? Опубликован рейтинг из 23 реальных задач
Рейтинг лучших AI-агентов OpenClaw: опубликованы результаты тестирования 23 реальных задач. Платформа MyToken представила прозрачный бенчмарк, оценивающий способности моделей на основе успешного выполнения задач. Ключевой критерий — процент успеха (Success Rate).
Тестирование включало 23 задачи: от создания событий в календаре и анализа акций до написания блогов и исследования рынка. Использовались три метода оценки: автоматизированная проверка, оценка моделью-судьёй (Claude Opus) и гибридный подход.
Топ-10 моделей по успешности (Best % / Avg %):
1. anthropic/claude-opus-4.6 — 93.3% / 82.0%
2. arcee-ai/trinity-large-thinking — 91.9% / 91.9%
3. openai/gpt-5.4 — 90.5% / 81.7%
4. qwen/qwen3.5-27b — 90.0% / 78.5%
5. minimax/minimax-m2.7 — 89.8% / 83.2%
Claude Opus показал наивысший результат, но Trinity от Arcee выделился стабильностью. Все методики и данные открыты для проверки.
marsbit04/08 14:47