Насколько сильно Claude Code расходует токены? Эксперимент: три фреймворка различаются в 30 раз

marsbitОпубликовано 2026-07-31Обновлено 2026-07-31

Введение

Сравнительное исследование трех фреймворков для AI-агентов (Claude Code, Hermes, Kimi Code), проведенное командой Composio, показало значительную разницу в потреблении токенов при выполнении одних и тех же 28 задач с использованием модели Kimi K3. Хотя показатели успешности выполнения были схожими (20-22 из 28), разница в использовании токенов оказалась огромной: Claude Code в среднем потреблял ~340 тыс. токенов, что примерно в 6 раз больше, чем у Kimi Code (~61 тыс.) и Hermes (~67 тыс.). В экстремальных случаях разница достигала 30 раз. Это напрямую повлияло на стоимость: средняя цена задачи составила около $0.22 для Kimi Code, $0.28 для Hermes и $2 для Claude Code. Hermes оказался самым быстрым по времени выполнения. Эксперт Себастьян Рашка подтвердил тенденцию, отметив, что Claude Code часто использует в 2-3 раза больше токенов при схожей эффективности. Анализ показал, что высокое потребление связано в основном с входными токенами: фреймворк Claude Code имеет тенденцию многократно передавать большие объемы контекста (историю сообщений, вызовы инструментов, вывод команд) в модели в ходе многошагового выполнения. Исследование подчеркивает растущую критическую важность выбора фреймворка (harness) для управления агентом, который может влиять на стоимость и эффективность не меньше, чем выбор самой модели. Компания Writer в отдельном эксперименте показала, что оптимизация слоя оркестрации может снизить средние затраты на 41%, а задержки — на 44%, практически без потери качест...

Все говорят, что Claude Code транжирит токены. Насколько сильно? Наконец-то появились конкретные цифры.

Недавно команда Composio провела интересный сравнительный эксперимент. Они использовали одну и ту же модель Kimi K3, запустили её в трёх разных агент-фреймворках (harness) — Claude Code, Hermes и Kimi Code — и выполнили 28 идентичных задач.

Результаты по успешности выполнения задач оказались схожими: Kimi Code справился с 22 из 28, Hermes — с 21, Claude Code — с 20. Разница невелика.

Но по расходу токенсов разница оказалась существенной. Одна и та же задача, выполняемая в разных harness, может потребовать в 30 раз больше токенов!

По медианным значениям, Kimi Code использовал около 61 тыс. токенов, Hermes — примерно 67 тыс., а Claude Code взлетел до 340 тыс., что примерно в 6 раз больше, чем у Kimi Code.

Если считать по цене модели Kimi K3 в 3 доллара за миллион входных токенов (во workflow агентов они обычно составляют около 95% от общего числа), средняя стоимость одной задачи получается такой: Kimi Code — 0.22 доллара, Hermes — 0.28 доллара, Claude Code — целых 2 доллара. Разница очевидна.

Разница есть и в скорости. По медианному времени выполнения: Hermes быстрее всего — 179 секунд; Kimi Code — 297 секунд; Claude Code — 348 секунд.

Таким образом, самый быстрый — Hermes, самый экономичный по токенам — Kimi Code. Эти звания не совпадают.

Команда Composio сделала простой вывод: если хотите снизить стоимость агента, сначала посмотрите, какой harness вы используете, а не спешите менять модель. Согласно их данным, сам harness может увеличить стоимость в 9 раз, тогда как возможности моделей примерно одинаковы.

Себастьян Рашка, увидев эти результаты, также написал пост, отметив, что это похоже на его наблюдения с Qwen3.6: при схожей успешности Claude Code часто тратит в 2-3 раза больше токенов, чем многие другие harness.

Он предложил несколько возможных причин: плохая оптимизация? Баг? Или намеренный дизайн (который может помочь в более сложных задачах)? Он отметил, что нужно потратить время на детальное изучение.

Затем он дополнил это наблюдением из своей статьи прошлого месяца о локальном coding agent. Анализируя, почему Claude Code использует больше токенов, он обнаружил, что разница в основном связана с входными токенами, а не с выходными. Другими словами, Claude не пишет вдвое больше кода. Логи показывают, что harness от Claude в ходе многошагового взаимодействия постоянно подсовывает модели больше контекста: предыдущие сообщения, вызовы инструментов, вывод команд и содержимое файлов. Например, в одном запуске Claude использовал около 578 тыс. входных токенов, но только около 4500 выходных токенов, пройдя 25 шагов. Таким образом, более вероятное объяснение заключается в том, что harness от Claude при многошаговой работе агента накапливает или учитывает более обширную историю в промпте.

Результаты этих тестов, похоже, выявляют важную тенденцию: важность harness уже не уступает важности самой модели.

Недавняя статья (от компании Writer, которая создает платформу для корпоративных AI Agent) систематически демонстрирует это: в эксперименте с контролируемыми переменными доказано, что замена слоя harness сокращает затраты больше, чем замена модели, и все модели от этого выигрывают.

Конкретнее, они провели строгий эксперимент с «контролируемыми переменными»: при неизменных 22 корпоративных задачах и 6 базовых моделях (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6) заменялся только слой оркестрации — традиционный продукционный цикл агента менялся на собственный Harness от Writer.

Результаты показали: средняя стоимость задачи снизилась на 41% (с 0.21 до 0.12 доллара), медианная задержка сократилась на 44% (с 48 до 27 секунд), расход токенов уменьшился на 38% (с 14.2k до 8.8k), а качество выполнения задач осталось примерно на том же уровне (0.78→0.81, что при небольшом объеме выборки можно считать незначительным). В плане рентабельности, качество на каждый потраченный доллар выросло на 82%, а количество задач, выполняемых за миллион токенов, выросло с 54.9 до 92.0.

Итак, после того как модели стали «коммунальными услугами», harness — это тот кондиционер, который определяет ваш счет за электричество? Иными словами: раньше говорили «продукт — это модель», теперь «продукт — это harness»?

Раз harness так важен, возможно, пора вести более детальную калькуляцию?

Кто-то отмечает, что в существующие бенчмарки необходимо добавить пункт «налог на harness». Особенно учитывая, что как только начинаются циклы вызова инструментов и повторных попыток, этот «налог» растет нелинейно.

Другими словами, будущие соревнования агентов будут делиться на два этапа: в первой половине будут сравнивать «может ли сделать», во второй — «кто сделает то же самое дешевле». А секрет экономии не в модели, а в harness.

Были ли у вас похожие впечатления при работе с агентами? Добро пожаловать в комментарии для обсуждения.

Статья из WeChat официального аккаунта «Машинное сердце» (ID: almosthuman2014), автор: Машинное сердце

Связанные с этим вопросы

QКаковы результаты сравнения расхода токенов в трех фреймворках (Claude Code, Hermes, Kimi Code) согласно исследованию Composio?

AСогласно исследованию, медианный расход токенов составляет: Kimi Code — около 61 тыс. токенов, Hermes — около 67 тыс. токенов, а Claude Code — около 340 тыс. токенов. Таким образом, Claude Code потребляет примерно в 6 раз больше токенов, чем Kimi Code, а максимальная разница между фреймворками может достигать 30 раз.

QКакие выводы делает команда Composio о влиянии фреймворка (harness) на стоимость выполнения задач?

AComposio приходит к выводу, что для снижения стоимости выполнения задач агентом, в первую очередь, стоит обратить внимание на используемый фреймворк (harness), а не на смену модели. Их данные показывают, что сам фреймворк может увеличивать стоимость в 9 раз, в то время как возможности моделей остаются схожими.

QКакое возможное объяснение высокого расхода токенов в Claude Code приводит Себастьян Рашка?

AСебастьян Рашка предполагает, что высокий расход токенов в Claude Code связан в первую очередь с входными токенами, а не с выходными. Его анализ показал, что фреймворк Claude Code в ходе многошагового выполнения агента многократно передает модели большие объемы контекста, включая предыдущие сообщения, вызовы инструментов, вывод команд и содержимое файлов.

QЧто означает концепция «налог на фреймворк» (harness tax), упомянутая в статье?

A«Налог на фреймворк» — это предложение учитывать дополнительные затраты (в первую очередь, токенов и, следовательно, стоимости), которые вносит сам фреймворк для организации работы агента, особенно при использовании вызовов инструментов и повторных попытках. Эти затраты могут расти нелинейно, и их важно отдельно учитывать при оценке эффективности различных решений.

QКак, согласно статье, меняется важность фреймворка (harness) по сравнению с моделью в разработке агентов?

AВ статье утверждается, что важность фреймворка (harness) для эффективности и стоимости агента стала сравнима с важностью самой модели или даже превысила ее. Если раньше фокус был на «модель как продукт», то теперь акцент смещается на «фреймворк как продукт», поскольку именно он в большей степени определяет конечную экономику выполнения задач.

Похожее

NEAR внедрила оплату ИИ через стейкинг

NEAR AI, платформа для конфиденциальных вычислений и автономных ИИ-агентов, представила новый способ оплаты вычислительных ресурсов для искусственного интеллекта через стейкинг токенов $NEAR. Вместо традиционной подписки с банковской картой пользователи могут заблокировать определенное количество $NEAR, получая ежемесячные вычислительные кредиты, объем которых зависит от суммы в стейкинге. При этом токены не списываются и остаются во владении пользователя, а после выхода из стейкинга могут быть возвращены на кошелек, при этом объем застейканных средств можно гибко регулировать в зависимости от потребностей. Механизм поддерживает 43 модели на платформе, включая решения от Anthropic, OpenAI и Google, и ориентирован на конфиденциальную обработку запросов и работу автономных агентов. Это решение стало первым практическим применением концепции «AI money», предложенной NEAR, которая напрямую связывает использование ИИ-сервисов с базовым криптоактивом сети.

cryptonews.ru13 мин. назад

NEAR внедрила оплату ИИ через стейкинг

cryptonews.ru13 мин. назад

Плохие новости для тех, кто ожидает крупного обвала биткоина (BTC): известный аналитик высказался по этому поводу очень четко!

Известный криптоаналитик Килла высказался против ожиданий значительного обвала биткоина (BTC). По его мнению, ведущая криптовалюта, торгующаяся около $64 000, достигла дна, и резкого падения до $36 000–48 000, которого опасаются многие инвесторы, не произойдет. Аналитик указывает, что в прошлых медвежьих циклах BTC формировал три ключевых минимума, и текущая ситуация, включая недавнее снижение до ~$59 000 и формирование бычьей дивергенции, говорит об укреплении рынка. Он считает, что условия для глубокого спада исчезли. Сейчас, по оценке эксперта, биткоин вошел в фазу накопления с важной нижней границей около $57 000. Хотя возможны краткосрочные падения ниже этого уровня, они не ознаменуют начало нового медвежьего тренда. Основываясь на исторических паттернах, аналитик заключает, что продолжительное и резкое снижение до диапазона $36 000–48 000 не соответствует текущей рыночной структуре, и если бы такая волна падения планировалась, она уже началась бы.

cryptonews.ru13 мин. назад

Плохие новости для тех, кто ожидает крупного обвала биткоина (BTC): известный аналитик высказался по этому поводу очень четко!

cryptonews.ru13 мин. назад

Акции падают сильнее, чем криптовалюта. Куда ушли деньги?

В конце июля южнокорейский фондовый рынок пережил историческое падение: индекс Kospi дважды сработал на остановку торгов, откатившись на 40% от пиков июня. Особенно пострадали полупроводниковые акции, такие как SK Hynix, чьи отличные, но не оправдавшие максимальных ожиданий результаты спровоцировали обвал. Ещё сильнее упали связанные с ними leveraged ETF, один из которых потерял 83% за месяц. Парадоксально, но в это же время биткоин, известный высокой волатильностью, показал относительную стабильность, даже немного вырос. Автор объясняет это не притоком «уклоняющихся» от акций денег, а тем, что биткоин уже пережил собственное сильное падение в мае-июне, когда инвесторы массово выводили средства из биткоин-ETF. Таким образом, к моменту кризиса на фондовом рынке продавцы в криптосфере уже истощились. Основная причина обвала — глобальное принудительное снижение левериджа (делеверидж) на самых перегретых направлениях, в первую очередь в AI и полупроводниках. Катализаторами стали не совсем идеальные отчёты компаний, выход на IPO китайского конкурента в производстве памяти и давление от сворачивания «кэрри-трейда» в японской иене. Настоящим убежищем для капитала в этой ситуации стало золото, цена которого значительно выросла. Биткоин же, по данным корреляции, перестал восприниматься институтами как «цифровое золото» и остаётся активом для роста с высокой долей риска. Вывод: деньги с фондового рынка не ушли в биткоин. Они ушли в наличность, гособлигации и золото. Биткоин просто уже пережил свою фазу распродаж раньше. Для его устойчивого роста нужны три условия: смягчение глобальной ликвидности, снижение ставок ФРС без рецессии и принятие чёткой регуляции (CLARITY Act). Его текущая низкая корреляция с Nasdaq может в будущем сделать его привлекательным для диверсификации портфелей, но только после окончания общей рыночной бури.

marsbit1 ч. назад

Акции падают сильнее, чем криптовалюта. Куда ушли деньги?

marsbit1 ч. назад

Торговля

Спот
活动图片