AI Agent выдает мусор? Проблема в том, что вы жалеете токены

marsbitОпубликовано 2026-03-23Обновлено 2026-03-23

Введение

Основной тезис статьи: качество вывода AI Agent напрямую зависит от количества использованных токенов. Автор утверждает, что увеличение объёма вычислений (токенов) снижает количество ошибок, аналогично тому, как дополнительные временные затраты улучшают результаты человеческой работы. Ключевые идеи: 1. Сложные задачи (напр., написание кода с множеством компонентов) решаемы при достаточном бюджете токенов 2. Исключение — принципиально новые проблемы, отсутствующие в обучающих данных: здесь токены бессильны 3. Практические методы улучшения: - Многократный автономный анализ кода (WAIT) - Ранняя и частая верификация работы через тесты и инструменты (VERIFY) Вывод: инвестиции в токены повышают качество решений, но требуют экспертного руководства в инновационных задачах.

Автор: Systematic Long Short

Компиляция: Deep Tide TechFlow

Введение от Deep Tide: Ключевой тезис этой статьи можно выразить одной фразой: качество вывода AI Agent прямо пропорционально количеству потраченных токенов.

Автор говорит не об абстрактной теории, а дает два конкретных метода, которые можно применять уже сегодня, и четко определяет границы, которые не преодолеть количеством токенов — «проблему новизны».

Для читателей, которые уже используют Agent для написания кода или рабочих процессов, информация здесь очень плотная и практичная.

Введение

Ладно, признайте, заголовок действительно броский — но, серьезно, это не шутка.

В 2023 году, когда мы использовали LLM для запуска продакшен-кода, окружающие были поражены, поскольку普遍 считалось, что LLM способны выдавать только непригодный мусор. Но мы знали то, чего другие не осознавали: качество вывода Agent — это функция от количества投入енных токенов. Все так просто.

Вы можете сами провести несколько экспериментов, чтобы убедиться в этом. Поручите Agent выполнить сложную, несколько нишевую programming задачу — например, с нуля реализовать алгоритм выпуклой оптимизации с ограничениями. Сначала выполните на минимальном уровне «размышлений»; затем переключитесь на максимальный, пусть он проверит свой код и посмотрит, сколько ошибок найдет. Попробуйте средний и высокий уровни. Вы наглядно увидите: количество ошибок монотонно уменьшается с ростом количества потраченных токенов.

Это несложно понять, верно?

Больше токенов = меньше ошибок. Вы можете продвинуть эту логику дальше, это basically упрощенная основная идея, стоящая за продуктами для code review. В совершенно новом контексте,投入ьте огромное количество токенов (например, заставьте его построчно анализировать код, определяя, есть ли в каждой строке ошибка) — так можно выловить绝大多数, если не все, ошибки. Этот процесс можно повторить десять, сто раз, каждый раз рассматривая код库 с «разных углов», и в конечном итоге вы выловите все ошибки.

У точки зрения, что «сжигание большего количества токенов повышает качество Agent», есть еще одно эмпирическое подтверждение: те команды, которые заявляют, что могут писать код с помощью Agent и сразу выкладывать его в продакшен, — либо сами провайдеры базовых моделей, либо компании с чрезвычайно большим финансированием.

Так что, если вы все еще расстраиваетесь, что Agent не выдает продакшен-код — скажу прямо, проблема в вас. Или, точнее, в вашем кошельке.

Как определить, достаточно ли я жгу токенов

Я написал целую статью о том, что проблема绝对 не в вашем фреймворке (harness), что «сохраняя простоту» still можно делать отличные вещи, и я до сих пор придерживаюсь этой точки зрения. Вы прочитали ту статью, последовали советам, но все равно разочарованы выводом Agent. Вы написали мне в DM, увидели, что я прочитал, но не ответил.

Эта статья — ответ.

Ваш Agent плохо справляется, не решает проблемы, в большинстве случаев просто потому, что вы жжете недостаточно токенов.

Сколько токенов нужно投入ить для решения проблемы, полностью зависит от масштаба, сложности и новизны этой проблемы.

«Сколько будет 2+2?» — много токенов не нужно.

«Напиши мне бота, который сканирует все рынки между Polymarket и Kalshi, находит семантически похожие рынки, которые должны结算 примерно в одно и то же событие, устанавливает границы безарбитражности и автоматически торгует с низкой задержкой при появлении арбитражной возможности» — для этого потребуется сжеть кучу токенов.

На практике мы обнаружили кое-что интересное.

Если вы投入ите достаточно токенов для решения проблем, вызванных масштабом и сложностью, Agent так или иначе справится. Другими словами, если вы хотите построить нечто чрезвычайно сложное, со множеством компонентов и строк кода,只要你 вложите足够多的 токенов в эти проблемы, они в конечном итоге будут полностью решены.

Здесь есть небольшое, но важное исключение.

Ваша проблема не должна быть слишком новой. На данном этапе никакое количество токенов не решит проблему «новизны». Достаточное количество токенов может снизить ошибки, вызванные сложностью, до нуля, но не может заставить Agent изобрести то, чего он не знает.

Этот вывод на самом деле нас обрадовал.

Мы потратили огромные усилия, сожгли — очень-очень много — токенов, пытаясь выяснить, сможет ли Agent восстановить институциональный инвестиционный процесс практически без нашего руководства. Отчасти это было сделано, чтобы понять, сколько лет нам (как количественным исследователям) осталось до полного вытеснения AI. Оказалось, что Agent просто не способен приблизиться к сколь-нибудь decentному институциональному процессу. Мы считаем, что отчасти это потому, что они никогда такого не видели — то есть, институциональные инвестиционные процессы в тренировочных данных просто не существовали.

Так что, если ваша проблема новаторская, не надейтесь решить ее堆чением токенов. Вам нужно самостоятельно направлять процесс исследования. Но как только вы определили план реализации, вы можете смело堆ть токены на execution —无论 код库多大、组件多复杂,都不是问题.

Вот простое эвристическое правило: Бюджет токенов должен расти пропорционально количеству строк кода.

Что на самом деле делают лишние токены

На практике дополнительные токены обычно повышают инженерное качество Agent следующими способами:

Позволяют ему потратить больше времени на рассуждения в одной попытке, дают шанс самостоятельно обнаружить ошибочную логику. Более глубокие рассуждения = лучшее планирование = выше вероятность успеха с первой попытки.

Позволяют ему сделать несколько независимых попыток, пойти разными путями решения. Некоторые пути лучше других. Разрешив more than one попытку, он может выбрать最优的.

Аналогично, больше независимых попыток планирования позволяют ему отказаться от слабых направлений и сохранить наиболее перспективные.

Больше токенов позволяют ему критиковать свою предыдущую работу в全新的 контексте, давая возможность улучшить,而不是 застрять в какой-то «инерции рассуждений».

И, конечно, мой любимый пункт: больше токенов означают, что он может использовать тесты и инструменты для проверки. Фактический запуск кода, чтобы посмотреть, работает ли он, — самый надежный способ подтвердить правильность ответа.

Эта логика работает, потому что инженерные неудачи Agent не случайны. Почти всегда они происходят из-за того, что слишком рано выбран неверный путь, не проверено, действительно ли этот путь可行 (на раннем этапе), или нет достаточного бюджета на восстановление и откат после обнаружения ошибки.

Вот и вся история. Токены буквально — это купленное вами качество решений. Представьте это как исследовательскую работу: если вы заставите человека сразу ответить на сложный вопрос, качество ответа будет падать с ростом временного давления.

Исследования, в конечном счете, это то, что порождает «знание ответа». Люди тратят биологическое время, чтобы дать лучшие ответы, Agent тратит больше вычислительного времени, чтобы дать лучшие ответы.

Как улучшить вашего Agent

Вы, возможно, все еще сомневаетесь, но есть много статей, подтверждающих это, и, честно говоря, само наличие «регулятора рассуждений» — это все доказательство, которое вам нужно.

Мне особенно нравится одна статья, где исследователи тренировали модель на небольшой тщательно отобранной выборке рассуждений, а затем强制 заставляли модель продолжать думать, когда она хотела остановиться — конкретно, добавляя «Wait» (Подожди) в месте, где она хотела остановиться.仅此一项, повысило результат в одном benchmark с 50% до 57%.

Я хочу быть максимально прямолинейным: если вы постоянно жалуетесь, что код от Agent получается посредственным, даже single最高档思考 для вас, скорее всего, недостаточно.

Я дам вам два очень простых решения.

Простое решение первое: WAIT (Подожди)

Самое простое, что вы можете начать делать уже сегодня: настройте автоматический цикл — после сборки пусть Agent reviewит свою работу N раз с全新 контекстом, каждый раз исправляя найденные проблемы.

Если вы обнаружите, что этот простой трюк улучшает результаты вашего инженерного Agent, то вы, по крайней мере, поняли, что ваша проблема — лишь в количестве токенов — тогда добро пожаловать в клуб сжигателей токенов.

Простое решение второе: VERIFY (Проверяй)

Заставляйте Agent проверять свою работу рано и часто. Пишите тесты, чтобы доказать, что выбранный путь действительно работает. Это особенно полезно для highly сложных, deeply вложенных проектов — одна функция может вызываться многими другими downstream функциями. Возможность поймать ошибку на upstream сэкономит вам массу последующего вычислительного времени (токенов). Так что, если возможно, расставляйте «контрольные точки проверки» throughout всего процесса сборки.

Написали что-то, главный Agent говорит, готово? Пусть второй Agent проверит. Несвязанные потоки мышления могут покрыть источники систематических смещений.

В основном, это все. Я мог бы написать намного больше на эту тему, но я считаю, что осознание этих двух вещей и их хорошая implementation помогут решить 95% ваших проблем. Я твердо верю в то, чтобы делать простые вещи превосходно, и добавлять сложность по мере необходимости.

Я упомянул, что «новизна» — это проблема, которую не решить токенами, и я хочу подчеркнуть это еще раз, потому что вы рано или поздно наткнетесь на эту яму и придете ко мне плакаться, что堆чение токенов не работает.

Когда проблема, которую вы хотите решить, отсутствует в тренировочном наборе, именно вы тот, кто должен предоставить решение. Следовательно, экспертные знания в предметной области по-прежнему чрезвычайно важны.

Связанные с этим вопросы

QКакова основная идея статьи о качестве вывода AI Agent?

AОсновная идея статьи заключается в том, что качество вывода AI Agent прямо пропорционально количеству использованных токенов. Чем больше токенов используется, тем меньше ошибок и выше качество результата.

QКакие два простых метода предлагает автор для улучшения работы AI Agent?

AАвтор предлагает два простых метода: WAIT (заставить Agent проверять свою работу несколько раз в новом контексте и исправлять ошибки) и VERIFY (ранняя и частая проверка работы с помощью тестов и привлечения второго Agent для валидации).

QВ каких случаях увеличение количества токенов не поможет улучшить результат AI Agent?

AУвеличение токенов не поможет, когда проблема является новой и отсутствует в обучающих данных. В таких случаях Agent не может изобрести то, чего он не видел, и требуется вмешательство эксперта для направления процесса.

QКак автор предлагает определять необходимый бюджет токенов для задачи?

AАвтор предлагает использовать эвристический принцип: бюджет токенов должен расти пропорционально количеству строк кода. Чем сложнее и масштабнее задача, тем больше токенов потребуется.

QКакие эмпирические доказательства приводит автор в поддержку своей теории?

AАвтор ссылается на то, что команды, успешно использующие Agent для написания production-кода, либо являются провайдерами базовых моделей, либо хорошо финансируемыми компаниями, способными позволить себе большое количество токенов.

Похожее

BitMine добавляет 7 430 ETH и тратит $86 млн на выкуп акций – Почему?

Компания Bitmine на прошлой неделе значительно сократила закупки Ethereum (ETH), приобретя лишь 7430 ETH — это минимальный еженедельный объем с мая. Вместо наращивания криптовалютного резерва компания направила примерно 86 млн долларов на обратный выкуп 5,5 млн своих обыкновенных акций по средней цене 15,62 доллара, чтобы повысить акционерную стоимость. Несмотря на замедление темпов покупки, резерв Bitmine по-прежнему огромен и составляет 5 777 468 ETH (около 4,8% от общего объема эмиссии ETH). Компания близка к достижению своей долгосрочной цели — владению 5% всех ETH. Уже через 12 месяцев после запуска стратегии фонд почти достиг этого показателя. Кроме того, Bitmine разместила в стейкинге через свою платформу MAVAN около 4,92 млн ETH (85% своих активов). Это может приносить примерно 247 млн долларов годового дохода при текущей доходности в 2,67%, а после стейкинга всего резерва доход может вырасти до 290 млн долларов. Параллельно в статье отмечается, что пока Bitmine фокусируется на Ethereum, компания MicroStrategy Майкла Сэйлора продолжает агрессивно накапливать Bitcoin (BTC), несмотря на финансовое давление и недавние продажи части активов.

ambcrypto24 мин. назад

BitMine добавляет 7 430 ETH и тратит $86 млн на выкуп акций – Почему?

ambcrypto24 мин. назад

9,42 миллиона частных инвесторов бросились покупать акции Changxin Technology, кто же выиграл в лотерее?

Результаты размещения акций Changxin Technology привлекли огромное внимание инвесторов. Всего в онлайн-подписке для частных инвесторов участвовало около 9,4288 миллиона человек, было подано 816,92 миллиарда заявок на акции, сгенерировано примерно 7,7 миллиона выигрышных лотерейных номеров, а итоговая ставка онлайн-подписки составила около 0,4714%, что является рекордно высоким показателем для новых акций на рынке STAR. Из-за высокого спроса компания активировала механизм обратного перевода, увеличив количество акций, размещаемых онлайн, до 3,851 миллиарда. Среди институциональных инвесторов 285 организаций, управляющих 10907 счетами, подали заявки на сумму около 12,38 триллиона акций, получив в итоге 2,173 миллиарда акций при коэффициенте распределения около 0,1756%. Taikang Asset Management стал институциональным инвестором, получившим наибольшее распределение. Среди публичных фондов лидерами по объему размещения стали E Fund, Southern Fund и ICBC Credit Suisse. Основатель ведущей китайской компании в области больших моделей DeepSeek, Лян Вэньфэн, через свои хедж-фонды Ningbo幻方量化 и Zhejiang九章资产 получил самое большое распределение среди частных фондов — акций на общую сумму примерно 1,75 миллиарда юаней. Ожидается, что Changxin Technology официально выйдет на биржу 27 июля. По оценкам рынка, её стоимость после IPO может превысить 1 триллион юаней, а некоторые аналитики дают прогноз до 2-3 триллионов юаней. Однако недавняя коррекция на глобальном технологическом рынке может оказать определенное влияние на цену акций компании после листинга.

marsbit49 мин. назад

9,42 миллиона частных инвесторов бросились покупать акции Changxin Technology, кто же выиграл в лотерее?

marsbit49 мин. назад

Криптовалюта USCR стабилизируется на отметке $0,0022: Сможет ли мемкоин отыграть потери второго квартала?

Криптовалюта USCR, мемкоин, отслеживающий тему официальных крипторезервов США, пытается восстановиться после падения до двухмесячного минимума в $0.0022. В мае цена выросла на 65%, но в июне упала на 37%. Сейчас наблюдается потенциальный отскок, и если быкам удастся закрепиться выше ключевых скользящих средних, возможен рост до $0.0028 (уровень Фибоначчи) и далее до майского пика в $0.0036, что означает потенциал роста на 30-60%. Динамика USCR тесно связана с новостями о создании стратегического резерва биткойна в США. Майский рост совпал с увеличением вероятности этого события и внесением соответствующего законопроекта. Однако его рассмотрение застопорилось, а шансы на создание резерва к 2027 году, по данным Polymarket, упали до 18%, что давит на настроения. Несмотря на неопределённость, база держателей USCR остаётся значительной: 48 тысяч, сократившись лишь на 4 тысячи с начала 2026 года. Восстановление цены будет зависеть от позитивных новостей по законопроекту о биткойн-резерве.

ambcrypto1 ч. назад

Криптовалюта USCR стабилизируется на отметке $0,0022: Сможет ли мемкоин отыграть потери второго квартала?

ambcrypto1 ч. назад

«Богиня благотворительности» с 3 млн подписчиков целиком создана ИИ, поддельный детский дом, международный «фальшивый фонд» рухнул за одну ночь

**Шокирующий разоблачение: Астролябка «благотворительности» с 300 000 подписчиков оказалась масштабной аферой на основе ИИ** Австралийская инфлюенсерша Лили Джей, имевшая почти 3 миллиона подписчиков в Instagram, создала тщательно продуманную мошенническую схему под прикрытием своего «Фонда Лили Джей». Используя искусственный интеллект, она и ее команда генерировали фальшивые изображения и видео, изображающие строительство мечетей, раздачу хлеба в Газе и даже открытие детского дома в Уганде для привлечения пожертвований от преимущественно мусульманской аудитории. Расследование ABC News Verify выявило многочисленные подделки: видео с «открытием» детского дома полностью сгенерировано ИИ (включая детей, саму Лили и фонды), «награда» за гуманитарную деятельность оказалась фальшивкой с цифровым водяным знаком ИИ, а заявленные благотворительные проекты в Уганде и Газе не существуют. Фонд не зарегистрирован как официальная благотворительная организация, что позволяло избегать финансовой отчетности. После запросов ABC сайт фонда стал скрывать кнопки для пожертвований и предупреждения о своем неблаготворительном статусе для посетителей из Австралии, но оставил их для иностранных пользователей. Эксперты предупреждают, что эта афера — тревожный прецедент, демонстрирующий, как ИИ может эксплуатировать человеческое доверие и желание творить добро, создавая убедительные, но полностью вымышленные нарративы.

marsbit1 ч. назад

«Богиня благотворительности» с 3 млн подписчиков целиком создана ИИ, поддельный детский дом, международный «фальшивый фонд» рухнул за одну ночь

marsbit1 ч. назад

L2 «рекалибровка»: когда L1 становится собственным ролл-апом, каков финал Ethereum?

«L2 перекалибровка»: когда L1 становится собственным роллапом, каков финал Ethereum? Первоначально, роллапы (L2) рассматривались как основной путь масштабирования Ethereum, обеспечивая дешёвое и быстрое исполнение транзакций. Однако, с развитием самого L1 (повышение лимита газа, внедрение безсостоятельности и zkEVM) и объединением задач масштабирования, традиционное разделение между L1 как безопасным, но медленным «слоем урегулирования» и L2 как дешёвым «слоем исполнения» меняется. Вопрос теперь не только в увеличении пространства блоков, а в перераспределении ролей в системе с множеством исполняющих сред. Будущая роль L2 смещается от простого предоставления дешёвого газа к обеспечению уникальных функций, таких как оптимизация для конкретных приложений, приватность и гибкие модели управления. Таким образом, L2 станет скорее спектром исполняющих сред с разной степенью наследования безопасности Ethereum, чем единым техническим классом. Ключевой задачей становится решение фрагментации. Разделённая ликвидность и состояние пользователя ухудшают опыт. Усилия концентрируются на улучшении взаимодействия (интероперабельности) через системы на основе намерений (intents) и нативные протоколы, такие как Ethereum Interoperability Layer (EIL), чтобы Ethereum вновь «ощущался как единая цепь». Сокращение времени до финальности транзакций L1 также имеет решающее значение для доверия между цепями. Ещё более радикальная идея — с появлением систем доказательств (zkEVM) внутри L1 сама Ethereum может стать своего рода «собственным роллапом», где высокопроизводительные узлы исполняют транзакции, а валидаторы проверяют криптографические доказательства. Это размывает классические границы между слоями и открывает путь к архитектуре, где множество исполняющих доменов (специализированных L2) сосуществуют, разделяя общую безопасность, ликвидность и систему урегулирования Ethereum. В итоге, будущее Ethereum видится не как победа L1 над L2 или наоборот, а как экосистема взаимосвязанных исполняющих сред, которые, будучи «разобранными» для масштабирования, вновь объединяются в единое, безопасное и удобное для пользователя целое.

marsbit1 ч. назад

L2 «рекалибровка»: когда L1 становится собственным ролл-апом, каков финал Ethereum?

marsbit1 ч. назад

Торговля

Спот
活动图片