Насколько сильно Claude Code расходует токены? Эксперимент: три фреймворка различаются в 30 раз

marsbitОпубликовано 2026-07-31Обновлено 2026-07-31

Введение

Сравнительное исследование трех фреймворков для AI-агентов (Claude Code, Hermes, Kimi Code), проведенное командой Composio, показало значительную разницу в потреблении токенов при выполнении одних и тех же 28 задач с использованием модели Kimi K3. Хотя показатели успешности выполнения были схожими (20-22 из 28), разница в использовании токенов оказалась огромной: Claude Code в среднем потреблял ~340 тыс. токенов, что примерно в 6 раз больше, чем у Kimi Code (~61 тыс.) и Hermes (~67 тыс.). В экстремальных случаях разница достигала 30 раз. Это напрямую повлияло на стоимость: средняя цена задачи составила около $0.22 для Kimi Code, $0.28 для Hermes и $2 для Claude Code. Hermes оказался самым быстрым по времени выполнения. Эксперт Себастьян Рашка подтвердил тенденцию, отметив, что Claude Code часто использует в 2-3 раза больше токенов при схожей эффективности. Анализ показал, что высокое потребление связано в основном с входными токенами: фреймворк Claude Code имеет тенденцию многократно передавать большие объемы контекста (историю сообщений, вызовы инструментов, вывод команд) в модели в ходе многошагового выполнения. Исследование подчеркивает растущую критическую важность выбора фреймворка (harness) для управления агентом, который может влиять на стоимость и эффективность не меньше, чем выбор самой модели. Компания Writer в отдельном эксперименте показала, что оптимизация слоя оркестрации может снизить средние затраты на 41%, а задержки — на 44%, практически без потери качест...

Все говорят, что Claude Code транжирит токены. Насколько сильно? Наконец-то появились конкретные цифры.

Недавно команда Composio провела интересный сравнительный эксперимент. Они использовали одну и ту же модель Kimi K3, запустили её в трёх разных агент-фреймворках (harness) — Claude Code, Hermes и Kimi Code — и выполнили 28 идентичных задач.

Результаты по успешности выполнения задач оказались схожими: Kimi Code справился с 22 из 28, Hermes — с 21, Claude Code — с 20. Разница невелика.

Но по расходу токенсов разница оказалась существенной. Одна и та же задача, выполняемая в разных harness, может потребовать в 30 раз больше токенов!

По медианным значениям, Kimi Code использовал около 61 тыс. токенов, Hermes — примерно 67 тыс., а Claude Code взлетел до 340 тыс., что примерно в 6 раз больше, чем у Kimi Code.

Если считать по цене модели Kimi K3 в 3 доллара за миллион входных токенов (во workflow агентов они обычно составляют около 95% от общего числа), средняя стоимость одной задачи получается такой: Kimi Code — 0.22 доллара, Hermes — 0.28 доллара, Claude Code — целых 2 доллара. Разница очевидна.

Разница есть и в скорости. По медианному времени выполнения: Hermes быстрее всего — 179 секунд; Kimi Code — 297 секунд; Claude Code — 348 секунд.

Таким образом, самый быстрый — Hermes, самый экономичный по токенам — Kimi Code. Эти звания не совпадают.

Команда Composio сделала простой вывод: если хотите снизить стоимость агента, сначала посмотрите, какой harness вы используете, а не спешите менять модель. Согласно их данным, сам harness может увеличить стоимость в 9 раз, тогда как возможности моделей примерно одинаковы.

Себастьян Рашка, увидев эти результаты, также написал пост, отметив, что это похоже на его наблюдения с Qwen3.6: при схожей успешности Claude Code часто тратит в 2-3 раза больше токенов, чем многие другие harness.

Он предложил несколько возможных причин: плохая оптимизация? Баг? Или намеренный дизайн (который может помочь в более сложных задачах)? Он отметил, что нужно потратить время на детальное изучение.

Затем он дополнил это наблюдением из своей статьи прошлого месяца о локальном coding agent. Анализируя, почему Claude Code использует больше токенов, он обнаружил, что разница в основном связана с входными токенами, а не с выходными. Другими словами, Claude не пишет вдвое больше кода. Логи показывают, что harness от Claude в ходе многошагового взаимодействия постоянно подсовывает модели больше контекста: предыдущие сообщения, вызовы инструментов, вывод команд и содержимое файлов. Например, в одном запуске Claude использовал около 578 тыс. входных токенов, но только около 4500 выходных токенов, пройдя 25 шагов. Таким образом, более вероятное объяснение заключается в том, что harness от Claude при многошаговой работе агента накапливает или учитывает более обширную историю в промпте.

Результаты этих тестов, похоже, выявляют важную тенденцию: важность harness уже не уступает важности самой модели.

Недавняя статья (от компании Writer, которая создает платформу для корпоративных AI Agent) систематически демонстрирует это: в эксперименте с контролируемыми переменными доказано, что замена слоя harness сокращает затраты больше, чем замена модели, и все модели от этого выигрывают.

Конкретнее, они провели строгий эксперимент с «контролируемыми переменными»: при неизменных 22 корпоративных задачах и 6 базовых моделях (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6) заменялся только слой оркестрации — традиционный продукционный цикл агента менялся на собственный Harness от Writer.

Результаты показали: средняя стоимость задачи снизилась на 41% (с 0.21 до 0.12 доллара), медианная задержка сократилась на 44% (с 48 до 27 секунд), расход токенов уменьшился на 38% (с 14.2k до 8.8k), а качество выполнения задач осталось примерно на том же уровне (0.78→0.81, что при небольшом объеме выборки можно считать незначительным). В плане рентабельности, качество на каждый потраченный доллар выросло на 82%, а количество задач, выполняемых за миллион токенов, выросло с 54.9 до 92.0.

Итак, после того как модели стали «коммунальными услугами», harness — это тот кондиционер, который определяет ваш счет за электричество? Иными словами: раньше говорили «продукт — это модель», теперь «продукт — это harness»?

Раз harness так важен, возможно, пора вести более детальную калькуляцию?

Кто-то отмечает, что в существующие бенчмарки необходимо добавить пункт «налог на harness». Особенно учитывая, что как только начинаются циклы вызова инструментов и повторных попыток, этот «налог» растет нелинейно.

Другими словами, будущие соревнования агентов будут делиться на два этапа: в первой половине будут сравнивать «может ли сделать», во второй — «кто сделает то же самое дешевле». А секрет экономии не в модели, а в harness.

Были ли у вас похожие впечатления при работе с агентами? Добро пожаловать в комментарии для обсуждения.

Статья из WeChat официального аккаунта «Машинное сердце» (ID: almosthuman2014), автор: Машинное сердце

Связанные с этим вопросы

QКаковы результаты сравнения расхода токенов в трех фреймворках (Claude Code, Hermes, Kimi Code) согласно исследованию Composio?

AСогласно исследованию, медианный расход токенов составляет: Kimi Code — около 61 тыс. токенов, Hermes — около 67 тыс. токенов, а Claude Code — около 340 тыс. токенов. Таким образом, Claude Code потребляет примерно в 6 раз больше токенов, чем Kimi Code, а максимальная разница между фреймворками может достигать 30 раз.

QКакие выводы делает команда Composio о влиянии фреймворка (harness) на стоимость выполнения задач?

AComposio приходит к выводу, что для снижения стоимости выполнения задач агентом, в первую очередь, стоит обратить внимание на используемый фреймворк (harness), а не на смену модели. Их данные показывают, что сам фреймворк может увеличивать стоимость в 9 раз, в то время как возможности моделей остаются схожими.

QКакое возможное объяснение высокого расхода токенов в Claude Code приводит Себастьян Рашка?

AСебастьян Рашка предполагает, что высокий расход токенов в Claude Code связан в первую очередь с входными токенами, а не с выходными. Его анализ показал, что фреймворк Claude Code в ходе многошагового выполнения агента многократно передает модели большие объемы контекста, включая предыдущие сообщения, вызовы инструментов, вывод команд и содержимое файлов.

QЧто означает концепция «налог на фреймворк» (harness tax), упомянутая в статье?

A«Налог на фреймворк» — это предложение учитывать дополнительные затраты (в первую очередь, токенов и, следовательно, стоимости), которые вносит сам фреймворк для организации работы агента, особенно при использовании вызовов инструментов и повторных попытках. Эти затраты могут расти нелинейно, и их важно отдельно учитывать при оценке эффективности различных решений.

QКак, согласно статье, меняется важность фреймворка (harness) по сравнению с моделью в разработке агентов?

AВ статье утверждается, что важность фреймворка (harness) для эффективности и стоимости агента стала сравнима с важностью самой модели или даже превысила ее. Если раньше фокус был на «модель как продукт», то теперь акцент смещается на «фреймворк как продукт», поскольку именно он в большей степени определяет конечную экономику выполнения задач.

Похожее

Меньшие инвестиции — это не беспроигрышный билет для Apple

Название статьи «Малое вложение — не спасательный круг Apple». Хотя Apple избежала огромных расходов на ИИ по сравнению с Meta, Google и другими технологическими гигантами, что ранее считалось преимуществом, это не уберегло ее от негативных последствий всеобщей ИИ-лихорадки. Несмотря на впечатляющие финансовые показатели за третий квартал 2026 финансового года — выручка в $109,4 млрд (рост 16,4%) и рекордные продажи iPhone и Mac — прогнозы компании на следующий квардел оказались пессимистичными. Ожидается рост выручки лишь на 9-11%, что ниже рыночных ожиданий. Главные проблемы — серьезные ограничения в цепочке поставок, особенно для Mac, вызванные ажиотажным спросом и переходом мощностей TSMC на производство ИИ-чипов. Это привело к резкому росту цен на компоненты (например, память) и вынудило Apple повысить цены на свою продукцию. Даже сдержанные капитальные затраты Apple (всего $68 млрд за 9 месяцев, снижение на 28,2%) и рекордный операционный денежный поток не спасли ее от этой волны. В то же время затраты на НИОКР компании резко выросли (до $11,7 млрд за квартал, +32,3%), но ощутимых прорывов в области ИИ это не принесло. Таким образом, Apple, хотя и не «сжигала» деньги на ИИ, как конкуренты, все равно страдает от побочных эффектов бума инвестиций в эту сферу: роста цен на комплектующие и дефицита мощностей. Ожидается, что давление на поставки и дальнейший рост цен, в том числе на новые iPhone, сохранятся. Эта квартальная отчетность стала последней для гендиректора Тима Кука перед его уходом в сентябре.

marsbit3 мин. назад

Меньшие инвестиции — это не беспроигрышный билет для Apple

marsbit3 мин. назад

PA Графика | Всё главное в Web3 за август 2026 в одной схеме

Август 2026 года на рынке Web3 будет насыщен ключевыми событиями. Основное внимание будет сосредоточено на макроэкономических данных, регуляторных изменениях, разблокировках токенов и корректировках в проектах. **Основные события августа:** * **Макроэкономика:** Будут опубликованы данные по занятости (NFP) и индексу потребительских цен (CPI) в США за июль. Также ожидаются протокол заседания ФРС и ежегодный симпозиум в Джексон Хоул. * **Регуляторные изменения:** Сенат США планирует представить новый проект закона «CLARITY Act». В Евросоюзе вступят в силу расширенные запреты на криптовалютные операции с Беларусью. * **Разблокировка токенов:** Ожидается массовая разблокировка токенов таких проектов, как ENA, AVAX, CONX, ZRO, KAITO, что может повлиять на волатильность рынка. * **Изменения в проектах:** Ряд сервисов, включая Exchange Art, Ctrl Wallet, Zapper, NFTfi и Summer.fi, прекратят работу или внесут существенные изменения. Пользователям рекомендуется принять меры по сохранности активов. * **Корпоративные события:** Компании SpaceX, Circle и Nvidia опубликуют финансовые отчеты за второй квартал. Китайская компания Unitree Robotics начнет размещение акций на бирже STAR Market, а Moonshot AI планирует привлечь финансирование на предстоящее IPO. * **Отраслевые мероприятия:** Пройдут конференции Bitcoin Asia 2026 и Digital Expo 2026. Главными темами августа останутся макроэкономические ожидания, внедрение регуляторных норм, разблокировка токенов и консолидация в отрасли.

marsbit16 мин. назад

PA Графика | Всё главное в Web3 за август 2026 в одной схеме

marsbit16 мин. назад

«Голос в пустыне» с Уолл-Стрит вновь прицелился в Nvidia

Новая сделка Майкла Берри, известного как «пророк биржевого апокалипсиса» после успешного шорта во время ипотечного кризиса, вновь привлекла внимание. Через свой Substack он объявил о шорте акций Nvidia (по цене входа $198.09), Tesla, Applied Materials, Caterpillar и ETF SOXX, а позднее добавил Micron Technology ($1051.87). 25 июля он увеличил позиции против Nvidia, Micron и SOXX. Его аргументы против Nvidia сосредоточены на проблемах в цепочке поставок ИИ: завышенные сроки амортизации оборудования (6 лет вместо реалистичных 2-3 лет) у таких клиентов, как Microsoft и Meta, что искусственно завышает их прибыль, и риски «внебалансового циклического финансирования», когда спрос на чипы может быть поддержан самой Nvidia через гарантии для покупателей. Третий аргумент о выкупе акций был оспорен компанией как основанный на ошибочных данных. Цена акций Nvidia колебалась после заявлений Берри, в целом оставаясь вблизи его цены входа, что привело к небольшому убытку по его более поздним позициям. История Берри после 2008 года неоднозначна: были как провалы (шорт Tesla в 2021), так и успехи (предупреждение о мемных акциях). Его методология, основанная на анализе свободного денежного потока и первичных документов, хорошо выявляет структурные риски, но плохо определяет время кризиса. Другие известные инвесторы разделяют осторожность, но действуют иначе. Стив Эйсман («Большой шорт») пока не шортит Nvidia, отмечая сильные текущие показатели, но сократил позиции. Джим Чанос согласен с тезисом об «учетном несоответствии», но шортит не чипмейкеров, а частные фонды, сочетающие ставки на ИИ и коммерческую недвижимость. Общий вывод: опытные инвесторы признают признаки перегрева в секторе ИИ, но их конкретные ставки и сроки сильно различаются. Для рядового инвестора ценным является не копирование их сделок, а понимание их методов анализа — куда смотреть, чтобы выявить скрытые риски и завышенные оценки, особенно когда рынок убежден, что «на этот раз все по-другому».

marsbit40 мин. назад

«Голос в пустыне» с Уолл-Стрит вновь прицелился в Nvidia

marsbit40 мин. назад

Когда рынок начинает сомневаться в капитальных затратах на ИИ: полный анализ квартальных отчетов пяти технологических гигантов

В конце июля 2026 года ведущие технологические гиганты — Alphabet (Google), Intel, Microsoft, Meta и Apple — представили квартальные отчёты. Все компании показали рост выручки и прибыли, превысив ожидания рынка, однако реакция инвесторов сильно различалась из-за расхождений в подходах к капитальным затратам (CAPEX) на ИИ и ожиданиях относительно свободного денежного потока. **Alphabet** продемонстрировал рекордный 12-й квартал двузначного роста выручки, а облачный бизнес вырос на 82%. Однако акции упали более чем на 7% после новостей о рекордных квартальных CAPEX в $44,9 млрд и первом в истории отрицательном свободном денежном потоке. Компания также повысила годовой прогноз по CAPEX. **Intel** сообщил о самом сильном росте выручки за 15 лет (25%), во многом благодаря бизнесу центров обработки данных и ИИ. Несмотря на это, акции испытали волатильность после увеличения годового прогноза CAPEX с $18 млрд до более чем $20 млрд, что усилило опасения по поводу денежного потока. **Microsoft** стала фаворитом рынка: выручка Azure впервые превысила $100 млрд в годовом исчислении. Ключевым положительным сигналом стало *снижение* прогноза по CAPEX на 2026 год с $190 млрд до $175 млрд и обещание положительного свободного денежного потока в 2027 финансовом году. Акции выросли, показав лучший однодневный результат за 18 лет. **Meta**, несмотря на рост выручки на 28%, столкнулась с самым резким падением акций (почти 10%). Причина — рост расходов на 55%, резкое сокращение свободного денежного потока на 90% и повышение годового прогноза по CAPEX. Это уже второй квартал подряд, когда Meta наказывают за рост затрат. **Apple** отчиталась о рекордной выручке и прибыли за июньский квартал, но её акции упали более чем на 8%, а рыночная капитализация сократилась на $300 млрд. Это произошло из-за консервативного прогноза на следующий квартал, который оказался ниже ожиданий Уолл-стрит, и опасений по поводу ограничений в цепочке поставок. **Общий вывод:** Рынок смещает фокус с абсолютных показателей выручки и прибыли на **доходность капитальных вложений**. Компании, демонстрирующие контроль над расходами и путь к положительному свободному денежному потоку (как Microsoft), вознаграждаются. Те, кто агрессивно наращивает CAPEX без четких краткосрочных перспектив возврата денежных средств (как Google и Meta), сталкиваются с продажами. В следующем отчётном сезоне объяснение стратегии CAPEX и его окупаемости будет критически важным для котировок акций.

Odaily星球日报54 мин. назад

Когда рынок начинает сомневаться в капитальных затратах на ИИ: полный анализ квартальных отчетов пяти технологических гигантов

Odaily星球日报54 мин. назад

a16z: От компании к DAO, DUNA может стать следующей организационной формой

Автор: a16z crypto Компиляция: Deep Tide TechFlow Основная задача бизнеса на протяжении веков остаётся неизменной: как организовать сотрудничество незнакомых людей с разными ролями, асимметричной информацией и интересами для достижения общей цели? История бизнеса — это история поиска новых организационных форм. Компания стала великим прорывом для индустриальной эпохи, но цифровые технологии и интернет-протоколы снижают потребность в традиционных иерархических структурах. Существующее законодательство не предназначено для нового мира децентрализованных сетей. DAO (децентрализованные автономные организации), хотя и являются перспективной формой, сталкиваются с правовыми проблемами: отсутствием юридического признания, что подвергает участников неограниченной ответственности, и неопределённостью в регулировании, особенно в свете теста Хоуи в США. В качестве решения предлагается DUNA (Децентрализованная Некорпоративная Некоммерческая Ассоциация) — новая правовая форма, уже принятая в нескольких штатах США. DUNA предоставляет группе людей юридическое лицо и ограниченную ответственность, позволяя децентрализованным сообществам легально владеть активами, заключать контракты и вести деятельность, не полагаясь на централизованное управление. Она заполняет правовой вакуум для интернет-нативных организаций, не решая всех проблем управления, но давая им законный статус. Эволюция организационных форм — от семейных предприятий и компаний до LLC и DUNA — расширяет инструменты для координации людей. DUNA представляет собой следующий шаг, позволяющий анонимным, географически разбросанным участникам блокчейн-сетей сотрудничать как единое юридическое лицо, минимизируя личные риски и открывая новую главу в организации коллективных действий.

marsbit1 ч. назад

a16z: От компании к DAO, DUNA может стать следующей организационной формой

marsbit1 ч. назад

Торговля

Спот
活动图片