Все говорят, что Claude Code транжирит токены. Насколько сильно? Наконец-то появились конкретные цифры.
Недавно команда Composio провела интересный сравнительный эксперимент. Они использовали одну и ту же модель Kimi K3, запустили её в трёх разных агент-фреймворках (harness) — Claude Code, Hermes и Kimi Code — и выполнили 28 идентичных задач.

Результаты по успешности выполнения задач оказались схожими: Kimi Code справился с 22 из 28, Hermes — с 21, Claude Code — с 20. Разница невелика.
Но по расходу токенсов разница оказалась существенной. Одна и та же задача, выполняемая в разных harness, может потребовать в 30 раз больше токенов!
По медианным значениям, Kimi Code использовал около 61 тыс. токенов, Hermes — примерно 67 тыс., а Claude Code взлетел до 340 тыс., что примерно в 6 раз больше, чем у Kimi Code.

Если считать по цене модели Kimi K3 в 3 доллара за миллион входных токенов (во workflow агентов они обычно составляют около 95% от общего числа), средняя стоимость одной задачи получается такой: Kimi Code — 0.22 доллара, Hermes — 0.28 доллара, Claude Code — целых 2 доллара. Разница очевидна.
Разница есть и в скорости. По медианному времени выполнения: Hermes быстрее всего — 179 секунд; Kimi Code — 297 секунд; Claude Code — 348 секунд.
Таким образом, самый быстрый — Hermes, самый экономичный по токенам — Kimi Code. Эти звания не совпадают.
Команда Composio сделала простой вывод: если хотите снизить стоимость агента, сначала посмотрите, какой harness вы используете, а не спешите менять модель. Согласно их данным, сам harness может увеличить стоимость в 9 раз, тогда как возможности моделей примерно одинаковы.

Себастьян Рашка, увидев эти результаты, также написал пост, отметив, что это похоже на его наблюдения с Qwen3.6: при схожей успешности Claude Code часто тратит в 2-3 раза больше токенов, чем многие другие harness.

Он предложил несколько возможных причин: плохая оптимизация? Баг? Или намеренный дизайн (который может помочь в более сложных задачах)? Он отметил, что нужно потратить время на детальное изучение.
Затем он дополнил это наблюдением из своей статьи прошлого месяца о локальном coding agent. Анализируя, почему Claude Code использует больше токенов, он обнаружил, что разница в основном связана с входными токенами, а не с выходными. Другими словами, Claude не пишет вдвое больше кода. Логи показывают, что harness от Claude в ходе многошагового взаимодействия постоянно подсовывает модели больше контекста: предыдущие сообщения, вызовы инструментов, вывод команд и содержимое файлов. Например, в одном запуске Claude использовал около 578 тыс. входных токенов, но только около 4500 выходных токенов, пройдя 25 шагов. Таким образом, более вероятное объяснение заключается в том, что harness от Claude при многошаговой работе агента накапливает или учитывает более обширную историю в промпте.

Результаты этих тестов, похоже, выявляют важную тенденцию: важность harness уже не уступает важности самой модели.
Недавняя статья (от компании Writer, которая создает платформу для корпоративных AI Agent) систематически демонстрирует это: в эксперименте с контролируемыми переменными доказано, что замена слоя harness сокращает затраты больше, чем замена модели, и все модели от этого выигрывают.

Конкретнее, они провели строгий эксперимент с «контролируемыми переменными»: при неизменных 22 корпоративных задачах и 6 базовых моделях (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6) заменялся только слой оркестрации — традиционный продукционный цикл агента менялся на собственный Harness от Writer.
Результаты показали: средняя стоимость задачи снизилась на 41% (с 0.21 до 0.12 доллара), медианная задержка сократилась на 44% (с 48 до 27 секунд), расход токенов уменьшился на 38% (с 14.2k до 8.8k), а качество выполнения задач осталось примерно на том же уровне (0.78→0.81, что при небольшом объеме выборки можно считать незначительным). В плане рентабельности, качество на каждый потраченный доллар выросло на 82%, а количество задач, выполняемых за миллион токенов, выросло с 54.9 до 92.0.
Итак, после того как модели стали «коммунальными услугами», harness — это тот кондиционер, который определяет ваш счет за электричество? Иными словами: раньше говорили «продукт — это модель», теперь «продукт — это harness»?

Раз harness так важен, возможно, пора вести более детальную калькуляцию?
Кто-то отмечает, что в существующие бенчмарки необходимо добавить пункт «налог на harness». Особенно учитывая, что как только начинаются циклы вызова инструментов и повторных попыток, этот «налог» растет нелинейно.

Другими словами, будущие соревнования агентов будут делиться на два этапа: в первой половине будут сравнивать «может ли сделать», во второй — «кто сделает то же самое дешевле». А секрет экономии не в модели, а в harness.

Были ли у вас похожие впечатления при работе с агентами? Добро пожаловать в комментарии для обсуждения.
Статья из WeChat официального аккаунта «Машинное сердце» (ID: almosthuman2014), автор: Машинное сердце





