Насколько сильно Claude Code расходует токены? Эксперимент: три фреймворка различаются в 30 раз

marsbitОпубликовано 2026-07-31Обновлено 2026-07-31

Введение

Сравнительное исследование трех фреймворков для AI-агентов (Claude Code, Hermes, Kimi Code), проведенное командой Composio, показало значительную разницу в потреблении токенов при выполнении одних и тех же 28 задач с использованием модели Kimi K3. Хотя показатели успешности выполнения были схожими (20-22 из 28), разница в использовании токенов оказалась огромной: Claude Code в среднем потреблял ~340 тыс. токенов, что примерно в 6 раз больше, чем у Kimi Code (~61 тыс.) и Hermes (~67 тыс.). В экстремальных случаях разница достигала 30 раз. Это напрямую повлияло на стоимость: средняя цена задачи составила около $0.22 для Kimi Code, $0.28 для Hermes и $2 для Claude Code. Hermes оказался самым быстрым по времени выполнения. Эксперт Себастьян Рашка подтвердил тенденцию, отметив, что Claude Code часто использует в 2-3 раза больше токенов при схожей эффективности. Анализ показал, что высокое потребление связано в основном с входными токенами: фреймворк Claude Code имеет тенденцию многократно передавать большие объемы контекста (историю сообщений, вызовы инструментов, вывод команд) в модели в ходе многошагового выполнения. Исследование подчеркивает растущую критическую важность выбора фреймворка (harness) для управления агентом, который может влиять на стоимость и эффективность не меньше, чем выбор самой модели. Компания Writer в отдельном эксперименте показала, что оптимизация слоя оркестрации может снизить средние затраты на 41%, а задержки — на 44%, практически без потери качест...

Все говорят, что Claude Code транжирит токены. Насколько сильно? Наконец-то появились конкретные цифры.

Недавно команда Composio провела интересный сравнительный эксперимент. Они использовали одну и ту же модель Kimi K3, запустили её в трёх разных агент-фреймворках (harness) — Claude Code, Hermes и Kimi Code — и выполнили 28 идентичных задач.

Результаты по успешности выполнения задач оказались схожими: Kimi Code справился с 22 из 28, Hermes — с 21, Claude Code — с 20. Разница невелика.

Но по расходу токенсов разница оказалась существенной. Одна и та же задача, выполняемая в разных harness, может потребовать в 30 раз больше токенов!

По медианным значениям, Kimi Code использовал около 61 тыс. токенов, Hermes — примерно 67 тыс., а Claude Code взлетел до 340 тыс., что примерно в 6 раз больше, чем у Kimi Code.

Если считать по цене модели Kimi K3 в 3 доллара за миллион входных токенов (во workflow агентов они обычно составляют около 95% от общего числа), средняя стоимость одной задачи получается такой: Kimi Code — 0.22 доллара, Hermes — 0.28 доллара, Claude Code — целых 2 доллара. Разница очевидна.

Разница есть и в скорости. По медианному времени выполнения: Hermes быстрее всего — 179 секунд; Kimi Code — 297 секунд; Claude Code — 348 секунд.

Таким образом, самый быстрый — Hermes, самый экономичный по токенам — Kimi Code. Эти звания не совпадают.

Команда Composio сделала простой вывод: если хотите снизить стоимость агента, сначала посмотрите, какой harness вы используете, а не спешите менять модель. Согласно их данным, сам harness может увеличить стоимость в 9 раз, тогда как возможности моделей примерно одинаковы.

Себастьян Рашка, увидев эти результаты, также написал пост, отметив, что это похоже на его наблюдения с Qwen3.6: при схожей успешности Claude Code часто тратит в 2-3 раза больше токенов, чем многие другие harness.

Он предложил несколько возможных причин: плохая оптимизация? Баг? Или намеренный дизайн (который может помочь в более сложных задачах)? Он отметил, что нужно потратить время на детальное изучение.

Затем он дополнил это наблюдением из своей статьи прошлого месяца о локальном coding agent. Анализируя, почему Claude Code использует больше токенов, он обнаружил, что разница в основном связана с входными токенами, а не с выходными. Другими словами, Claude не пишет вдвое больше кода. Логи показывают, что harness от Claude в ходе многошагового взаимодействия постоянно подсовывает модели больше контекста: предыдущие сообщения, вызовы инструментов, вывод команд и содержимое файлов. Например, в одном запуске Claude использовал около 578 тыс. входных токенов, но только около 4500 выходных токенов, пройдя 25 шагов. Таким образом, более вероятное объяснение заключается в том, что harness от Claude при многошаговой работе агента накапливает или учитывает более обширную историю в промпте.

Результаты этих тестов, похоже, выявляют важную тенденцию: важность harness уже не уступает важности самой модели.

Недавняя статья (от компании Writer, которая создает платформу для корпоративных AI Agent) систематически демонстрирует это: в эксперименте с контролируемыми переменными доказано, что замена слоя harness сокращает затраты больше, чем замена модели, и все модели от этого выигрывают.

Конкретнее, они провели строгий эксперимент с «контролируемыми переменными»: при неизменных 22 корпоративных задачах и 6 базовых моделях (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6) заменялся только слой оркестрации — традиционный продукционный цикл агента менялся на собственный Harness от Writer.

Результаты показали: средняя стоимость задачи снизилась на 41% (с 0.21 до 0.12 доллара), медианная задержка сократилась на 44% (с 48 до 27 секунд), расход токенов уменьшился на 38% (с 14.2k до 8.8k), а качество выполнения задач осталось примерно на том же уровне (0.78→0.81, что при небольшом объеме выборки можно считать незначительным). В плане рентабельности, качество на каждый потраченный доллар выросло на 82%, а количество задач, выполняемых за миллион токенов, выросло с 54.9 до 92.0.

Итак, после того как модели стали «коммунальными услугами», harness — это тот кондиционер, который определяет ваш счет за электричество? Иными словами: раньше говорили «продукт — это модель», теперь «продукт — это harness»?

Раз harness так важен, возможно, пора вести более детальную калькуляцию?

Кто-то отмечает, что в существующие бенчмарки необходимо добавить пункт «налог на harness». Особенно учитывая, что как только начинаются циклы вызова инструментов и повторных попыток, этот «налог» растет нелинейно.

Другими словами, будущие соревнования агентов будут делиться на два этапа: в первой половине будут сравнивать «может ли сделать», во второй — «кто сделает то же самое дешевле». А секрет экономии не в модели, а в harness.

Были ли у вас похожие впечатления при работе с агентами? Добро пожаловать в комментарии для обсуждения.

Статья из WeChat официального аккаунта «Машинное сердце» (ID: almosthuman2014), автор: Машинное сердце

Связанные с этим вопросы

QКаковы результаты сравнения расхода токенов в трех фреймворках (Claude Code, Hermes, Kimi Code) согласно исследованию Composio?

AСогласно исследованию, медианный расход токенов составляет: Kimi Code — около 61 тыс. токенов, Hermes — около 67 тыс. токенов, а Claude Code — около 340 тыс. токенов. Таким образом, Claude Code потребляет примерно в 6 раз больше токенов, чем Kimi Code, а максимальная разница между фреймворками может достигать 30 раз.

QКакие выводы делает команда Composio о влиянии фреймворка (harness) на стоимость выполнения задач?

AComposio приходит к выводу, что для снижения стоимости выполнения задач агентом, в первую очередь, стоит обратить внимание на используемый фреймворк (harness), а не на смену модели. Их данные показывают, что сам фреймворк может увеличивать стоимость в 9 раз, в то время как возможности моделей остаются схожими.

QКакое возможное объяснение высокого расхода токенов в Claude Code приводит Себастьян Рашка?

AСебастьян Рашка предполагает, что высокий расход токенов в Claude Code связан в первую очередь с входными токенами, а не с выходными. Его анализ показал, что фреймворк Claude Code в ходе многошагового выполнения агента многократно передает модели большие объемы контекста, включая предыдущие сообщения, вызовы инструментов, вывод команд и содержимое файлов.

QЧто означает концепция «налог на фреймворк» (harness tax), упомянутая в статье?

A«Налог на фреймворк» — это предложение учитывать дополнительные затраты (в первую очередь, токенов и, следовательно, стоимости), которые вносит сам фреймворк для организации работы агента, особенно при использовании вызовов инструментов и повторных попытках. Эти затраты могут расти нелинейно, и их важно отдельно учитывать при оценке эффективности различных решений.

QКак, согласно статье, меняется важность фреймворка (harness) по сравнению с моделью в разработке агентов?

AВ статье утверждается, что важность фреймворка (harness) для эффективности и стоимости агента стала сравнима с важностью самой модели или даже превысила ее. Если раньше фокус был на «модель как продукт», то теперь акцент смещается на «фреймворк как продукт», поскольку именно он в большей степени определяет конечную экономику выполнения задач.

Похожее

Компания HumidiFi приостанавливает торговлю послеdentв сети, что ограничивает влияние на наши внутренние средства

Децентрализованная биржа HumidiFi на Solana приостановила торговлю после инцидента с безопасностью в своей сети. Компания заявила, что ущерб ограничился её внутренними средствами, а активы клиентов и третьих лиц не пострадали. Подробности атаки и сумма убытков не раскрываются. По данным DefiLlama, за последние сутки на платформе было обработано сделок на сумму около $213,79 млн. Ранее у HumidiFi уже возникали проблемы: продажа токенов на Jupiter была сорвана из-за действий злоумышленника с использованием автоматизированных кошельков. Распродажа была отменена, команда пообещала провести новый выпуск токенов для добросовестных участников. Этот инцидент происходит на фоне роста числа атак в сфере цифровых активов. Во втором квартале 2026 года было зафиксировано рекордное количество инцидентов — около 83, общий ущерб от которых составил примерно $775 млн.

cryptonews.ru28 мин. назад

Компания HumidiFi приостанавливает торговлю послеdentв сети, что ограничивает влияние на наши внутренние средства

cryptonews.ru28 мин. назад

Биткойн подскочил на 10 000 долларов за неделю, а игроки, открывшие короткие позиции, потеряли 3 миллиарда долларов

Биткоин вырос на 10 000 долларов за неделю, преодолев шестинедельный диапазон колебаний. Резкий скачок был спровоцирован решением Министерства финансов США увеличить объем операций по выкупу долгосрочных казначейских облигаций для поддержки ликвидности. Это привело к снижению доходности гособлигаций, и инвесторы начали рассматривать биткоин как инструмент хеджирования на фоне ожиданий смягчения денежно-кредитной политики. Прорыв цены выше уровня сопротивления в 70 000 долларов вызвал масштабное сжатие коротких позиций (шорт-сквиз). Продавцы, ставившие на понижение, за сутки потеряли около 3 млрд долларов, что стало крупнейшим обнулением таких позиций с 2021 года. Вынужденные закрытия усугубили восходящее движение. Росту также способствовал политический контекст: призыв президента Трампа принять закон CLARITY для регулирования цифровых активов и его встреча с лидерами криптоиндустрии укрепили мнение о растущей лояльности властей. Рост биткоина до 80 000 долларов стал первым с мая возвращением к этому уровню на фоне укрепляющихся рыночных индикаторов.

cryptonews.ru30 мин. назад

Биткойн подскочил на 10 000 долларов за неделю, а игроки, открывшие короткие позиции, потеряли 3 миллиарда долларов

cryptonews.ru30 мин. назад

Zcash, Bitcoin Cash и Cardano демонстрируют рост, причем ZEC лидирует с подъёмом на 47 %

За последние 24 часа наблюдается значительный рост цен на альткоины. Лидером стала монета с акцентом на конфиденциальность Zcash (ZEC), которая поднялась на 47.1%, достигнув $836, а затем стабилизировалась около $810. Bitcoin Cash (BCH) вырос на 31.4%, Cardano (ADA) — на 19%, Dogecoin (DOGE) и токен Whitebit (WBT) — на 17.7%. Рост Zcash связывают с интересом к приватности и планами Grayscale преобразовать свой Zcash Trust в спотовый биржевой фонд (ETF) в США, что стало бы первым подобным ETF. Общий бычий тренд на рынке поддержан энтузиазмом президента США Дональда Трампа в отношении «Закона о прозрачности рынка цифровых активов», а также расширением программы выкупа облигаций Министерством финансов, что высвободило ликвидность для рисковых активов. Росту способствовал и значительный рост торговых объемов, указывающий на реальный интерес, а не на низкую ликвидность. Аналитики отмечают, что такие масштабные ралли часто сопровождаются высоким кредитным плечом, что может усилить как рост, так и потенциальную коррекцию. Дальнейшая динамика будет зависеть от прогресса в криптовалютном законодательстве.

cryptonews.ru31 мин. назад

Zcash, Bitcoin Cash и Cardano демонстрируют рост, причем ZEC лидирует с подъёмом на 47 %

cryptonews.ru31 мин. назад

В связи с изменением стратегий следует ожидать изменений в системе вознаграждений и комиссионных на криптовалютных биржах

Крупнейшие криптобиржи (Coinbase, Bullish, Gemini) столкнулись со снижением торговых доходов во втором квартале на фоне медвежьего рынка. В ответ они корректируют стратегии, смещая акцент на новые продукты, чтобы снизить зависимость от волатильности рынка. Coinbase сокращает расходы, но увеличивает вознаграждения за хранение стейблкоина USDC, объём которого на её платформе вырос на 44% за год. Gemini уделяет больше внимания рынкам прогнозов, увеличивая число маркет-мейкеров и вводя систему вознаграждений пользователям. Bullish, сосредоточенная на профессиональных трейдерах, внедрила новую программу вознаграждений, что помогло ей показать рост торговой выручки в годовом исчислении — единственной из трёх. Хотя торговые доходы падали, экономика комиссий на некоторых биржах (например, Gemini) улучшалась. В будущем, если тренд рынка изменится, можно ожидать восстановления торговых доходов. Однако биржи, диверсифицируя продукты, будут предлагать больше вознаграждений пользователям новых направлений. Конкуренция в сфере комиссий может усилиться, чему также будет способствовать стирание границ между криптоплатформами и традиционными финансами.

cryptonews.ru32 мин. назад

В связи с изменением стратегий следует ожидать изменений в системе вознаграждений и комиссионных на криптовалютных биржах

cryptonews.ru32 мин. назад

Торговля

Спот
活动图片