AI Agent выдает мусор? Проблема в том, что вы жалеете токены

marsbitОпубликовано 2026-03-23Обновлено 2026-03-23

Введение

Основной тезис статьи: качество вывода AI Agent напрямую зависит от количества использованных токенов. Автор утверждает, что увеличение объёма вычислений (токенов) снижает количество ошибок, аналогично тому, как дополнительные временные затраты улучшают результаты человеческой работы. Ключевые идеи: 1. Сложные задачи (напр., написание кода с множеством компонентов) решаемы при достаточном бюджете токенов 2. Исключение — принципиально новые проблемы, отсутствующие в обучающих данных: здесь токены бессильны 3. Практические методы улучшения: - Многократный автономный анализ кода (WAIT) - Ранняя и частая верификация работы через тесты и инструменты (VERIFY) Вывод: инвестиции в токены повышают качество решений, но требуют экспертного руководства в инновационных задачах.

Автор: Systematic Long Short

Компиляция: Deep Tide TechFlow

Введение от Deep Tide: Ключевой тезис этой статьи можно выразить одной фразой: качество вывода AI Agent прямо пропорционально количеству потраченных токенов.

Автор говорит не об абстрактной теории, а дает два конкретных метода, которые можно применять уже сегодня, и четко определяет границы, которые не преодолеть количеством токенов — «проблему новизны».

Для читателей, которые уже используют Agent для написания кода или рабочих процессов, информация здесь очень плотная и практичная.

Введение

Ладно, признайте, заголовок действительно броский — но, серьезно, это не шутка.

В 2023 году, когда мы использовали LLM для запуска продакшен-кода, окружающие были поражены, поскольку普遍 считалось, что LLM способны выдавать только непригодный мусор. Но мы знали то, чего другие не осознавали: качество вывода Agent — это функция от количества投入енных токенов. Все так просто.

Вы можете сами провести несколько экспериментов, чтобы убедиться в этом. Поручите Agent выполнить сложную, несколько нишевую programming задачу — например, с нуля реализовать алгоритм выпуклой оптимизации с ограничениями. Сначала выполните на минимальном уровне «размышлений»; затем переключитесь на максимальный, пусть он проверит свой код и посмотрит, сколько ошибок найдет. Попробуйте средний и высокий уровни. Вы наглядно увидите: количество ошибок монотонно уменьшается с ростом количества потраченных токенов.

Это несложно понять, верно?

Больше токенов = меньше ошибок. Вы можете продвинуть эту логику дальше, это basically упрощенная основная идея, стоящая за продуктами для code review. В совершенно новом контексте,投入ьте огромное количество токенов (например, заставьте его построчно анализировать код, определяя, есть ли в каждой строке ошибка) — так можно выловить绝大多数, если не все, ошибки. Этот процесс можно повторить десять, сто раз, каждый раз рассматривая код库 с «разных углов», и в конечном итоге вы выловите все ошибки.

У точки зрения, что «сжигание большего количества токенов повышает качество Agent», есть еще одно эмпирическое подтверждение: те команды, которые заявляют, что могут писать код с помощью Agent и сразу выкладывать его в продакшен, — либо сами провайдеры базовых моделей, либо компании с чрезвычайно большим финансированием.

Так что, если вы все еще расстраиваетесь, что Agent не выдает продакшен-код — скажу прямо, проблема в вас. Или, точнее, в вашем кошельке.

Как определить, достаточно ли я жгу токенов

Я написал целую статью о том, что проблема绝对 не в вашем фреймворке (harness), что «сохраняя простоту» still можно делать отличные вещи, и я до сих пор придерживаюсь этой точки зрения. Вы прочитали ту статью, последовали советам, но все равно разочарованы выводом Agent. Вы написали мне в DM, увидели, что я прочитал, но не ответил.

Эта статья — ответ.

Ваш Agent плохо справляется, не решает проблемы, в большинстве случаев просто потому, что вы жжете недостаточно токенов.

Сколько токенов нужно投入ить для решения проблемы, полностью зависит от масштаба, сложности и новизны этой проблемы.

«Сколько будет 2+2?» — много токенов не нужно.

«Напиши мне бота, который сканирует все рынки между Polymarket и Kalshi, находит семантически похожие рынки, которые должны结算 примерно в одно и то же событие, устанавливает границы безарбитражности и автоматически торгует с низкой задержкой при появлении арбитражной возможности» — для этого потребуется сжеть кучу токенов.

На практике мы обнаружили кое-что интересное.

Если вы投入ите достаточно токенов для решения проблем, вызванных масштабом и сложностью, Agent так или иначе справится. Другими словами, если вы хотите построить нечто чрезвычайно сложное, со множеством компонентов и строк кода,只要你 вложите足够多的 токенов в эти проблемы, они в конечном итоге будут полностью решены.

Здесь есть небольшое, но важное исключение.

Ваша проблема не должна быть слишком новой. На данном этапе никакое количество токенов не решит проблему «новизны». Достаточное количество токенов может снизить ошибки, вызванные сложностью, до нуля, но не может заставить Agent изобрести то, чего он не знает.

Этот вывод на самом деле нас обрадовал.

Мы потратили огромные усилия, сожгли — очень-очень много — токенов, пытаясь выяснить, сможет ли Agent восстановить институциональный инвестиционный процесс практически без нашего руководства. Отчасти это было сделано, чтобы понять, сколько лет нам (как количественным исследователям) осталось до полного вытеснения AI. Оказалось, что Agent просто не способен приблизиться к сколь-нибудь decentному институциональному процессу. Мы считаем, что отчасти это потому, что они никогда такого не видели — то есть, институциональные инвестиционные процессы в тренировочных данных просто не существовали.

Так что, если ваша проблема новаторская, не надейтесь решить ее堆чением токенов. Вам нужно самостоятельно направлять процесс исследования. Но как только вы определили план реализации, вы можете смело堆ть токены на execution —无论 код库多大、组件多复杂,都不是问题.

Вот простое эвристическое правило: Бюджет токенов должен расти пропорционально количеству строк кода.

Что на самом деле делают лишние токены

На практике дополнительные токены обычно повышают инженерное качество Agent следующими способами:

Позволяют ему потратить больше времени на рассуждения в одной попытке, дают шанс самостоятельно обнаружить ошибочную логику. Более глубокие рассуждения = лучшее планирование = выше вероятность успеха с первой попытки.

Позволяют ему сделать несколько независимых попыток, пойти разными путями решения. Некоторые пути лучше других. Разрешив more than one попытку, он может выбрать最优的.

Аналогично, больше независимых попыток планирования позволяют ему отказаться от слабых направлений и сохранить наиболее перспективные.

Больше токенов позволяют ему критиковать свою предыдущую работу в全新的 контексте, давая возможность улучшить,而不是 застрять в какой-то «инерции рассуждений».

И, конечно, мой любимый пункт: больше токенов означают, что он может использовать тесты и инструменты для проверки. Фактический запуск кода, чтобы посмотреть, работает ли он, — самый надежный способ подтвердить правильность ответа.

Эта логика работает, потому что инженерные неудачи Agent не случайны. Почти всегда они происходят из-за того, что слишком рано выбран неверный путь, не проверено, действительно ли этот путь可行 (на раннем этапе), или нет достаточного бюджета на восстановление и откат после обнаружения ошибки.

Вот и вся история. Токены буквально — это купленное вами качество решений. Представьте это как исследовательскую работу: если вы заставите человека сразу ответить на сложный вопрос, качество ответа будет падать с ростом временного давления.

Исследования, в конечном счете, это то, что порождает «знание ответа». Люди тратят биологическое время, чтобы дать лучшие ответы, Agent тратит больше вычислительного времени, чтобы дать лучшие ответы.

Как улучшить вашего Agent

Вы, возможно, все еще сомневаетесь, но есть много статей, подтверждающих это, и, честно говоря, само наличие «регулятора рассуждений» — это все доказательство, которое вам нужно.

Мне особенно нравится одна статья, где исследователи тренировали модель на небольшой тщательно отобранной выборке рассуждений, а затем强制 заставляли модель продолжать думать, когда она хотела остановиться — конкретно, добавляя «Wait» (Подожди) в месте, где она хотела остановиться.仅此一项, повысило результат в одном benchmark с 50% до 57%.

Я хочу быть максимально прямолинейным: если вы постоянно жалуетесь, что код от Agent получается посредственным, даже single最高档思考 для вас, скорее всего, недостаточно.

Я дам вам два очень простых решения.

Простое решение первое: WAIT (Подожди)

Самое простое, что вы можете начать делать уже сегодня: настройте автоматический цикл — после сборки пусть Agent reviewит свою работу N раз с全新 контекстом, каждый раз исправляя найденные проблемы.

Если вы обнаружите, что этот простой трюк улучшает результаты вашего инженерного Agent, то вы, по крайней мере, поняли, что ваша проблема — лишь в количестве токенов — тогда добро пожаловать в клуб сжигателей токенов.

Простое решение второе: VERIFY (Проверяй)

Заставляйте Agent проверять свою работу рано и часто. Пишите тесты, чтобы доказать, что выбранный путь действительно работает. Это особенно полезно для highly сложных, deeply вложенных проектов — одна функция может вызываться многими другими downstream функциями. Возможность поймать ошибку на upstream сэкономит вам массу последующего вычислительного времени (токенов). Так что, если возможно, расставляйте «контрольные точки проверки» throughout всего процесса сборки.

Написали что-то, главный Agent говорит, готово? Пусть второй Agent проверит. Несвязанные потоки мышления могут покрыть источники систематических смещений.

В основном, это все. Я мог бы написать намного больше на эту тему, но я считаю, что осознание этих двух вещей и их хорошая implementation помогут решить 95% ваших проблем. Я твердо верю в то, чтобы делать простые вещи превосходно, и добавлять сложность по мере необходимости.

Я упомянул, что «новизна» — это проблема, которую не решить токенами, и я хочу подчеркнуть это еще раз, потому что вы рано или поздно наткнетесь на эту яму и придете ко мне плакаться, что堆чение токенов не работает.

Когда проблема, которую вы хотите решить, отсутствует в тренировочном наборе, именно вы тот, кто должен предоставить решение. Следовательно, экспертные знания в предметной области по-прежнему чрезвычайно важны.

Связанные с этим вопросы

QКакова основная идея статьи о качестве вывода AI Agent?

AОсновная идея статьи заключается в том, что качество вывода AI Agent прямо пропорционально количеству использованных токенов. Чем больше токенов используется, тем меньше ошибок и выше качество результата.

QКакие два простых метода предлагает автор для улучшения работы AI Agent?

AАвтор предлагает два простых метода: WAIT (заставить Agent проверять свою работу несколько раз в новом контексте и исправлять ошибки) и VERIFY (ранняя и частая проверка работы с помощью тестов и привлечения второго Agent для валидации).

QВ каких случаях увеличение количества токенов не поможет улучшить результат AI Agent?

AУвеличение токенов не поможет, когда проблема является новой и отсутствует в обучающих данных. В таких случаях Agent не может изобрести то, чего он не видел, и требуется вмешательство эксперта для направления процесса.

QКак автор предлагает определять необходимый бюджет токенов для задачи?

AАвтор предлагает использовать эвристический принцип: бюджет токенов должен расти пропорционально количеству строк кода. Чем сложнее и масштабнее задача, тем больше токенов потребуется.

QКакие эмпирические доказательства приводит автор в поддержку своей теории?

AАвтор ссылается на то, что команды, успешно использующие Agent для написания production-кода, либо являются провайдерами базовых моделей, либо хорошо финансируемыми компаниями, способными позволить себе большое количество токенов.

Похожее

Диалог с Далио: Сейчас мы находимся в пузыре ИИ, 1% моего инвестиционного портфеля — это биткоин

Источник: интервью Рэя Далио, основателя Bridgewater Associates, для подкаста "The Diary Of A CEO". Далио, предсказавший кризис 2008 года, обсуждает "большой цикл" — концепцию, охватывающую долговые проблемы, растущее неравенство и геополитические сдвиги. Он указывает, что текущий ажиотаж вокруг ИИ демонстрирует классические признаки пузыря, который может лопнуть из-за высокой долговой нагрузки, роста процентных ставок и чрезмерной эмиссии акций, что способно привести к рецессии. Для защиты личного капитала в неопределенные времена Далио советует диверсификацию: вместо хранения наличных инвестировать в акции, золото, облигации. Сам он держит около 1% портфеля в биткоине, считая его "твердыми деньгами", но предпочитает физическое золото из-за его статуса резервного актива и независимости от технологических рисков. Говоря о влиянии ИИ, Далио отмечает, что технология заменяет не только физический труд, но и элементы мышления, что увеличит разрыв между капиталом и трудом. Ключевыми останутся человеческие качества — эмоции и интуиция, а успеха добьются те, кто научится работать в партнерстве с ИИ. На геополитической арене, по его мнению, мир движется к регионализации с центрами в виде США и Китая. Вовлечение США в конфликты, подобные иранскому, обнажает снижение их абсолютного влияния. Внутренние вызовы, такие как дебаты о налогах на богатство, риск капитального бегства и низкая производительность, также ставят под вопрос стабильность традиционных держав в текущей фазе цикла.

marsbit2 ч. назад

Диалог с Далио: Сейчас мы находимся в пузыре ИИ, 1% моего инвестиционного портфеля — это биткоин

marsbit2 ч. назад

7.2 трлн вон за один день: иностранные инвесторы установили рекорд чистых покупок в пятницу! Уолл-Стрит: встречный ветер в плане ликвидности на южнокорейском рынке уже утих

Капиталы возвращаются на южнокорейский рынок акций. 31 июля иностранные инвесторы осуществили чистые покупки акций KOSPI на рекордные 7,2 трлн вон за один день, что стало самым высоким показателем в истории. По данным Citigroup, эта цифра знаменует собой кардинальный разворот после месяцев масштабного оттока средств нерезидентов. В июле чистые продажи иностранными инвесторами значительно сократились до 9,8 трлн вон по сравнению с 48,4 трлн и 44,5 трлн вон в июне и мае соответственно. Одновременно внутренние пенсионные и инвестиционные фонды в июле вернулись к чистым покупкам на 1,0 трлн вон. Дополнительным фактором снижения волатильности стали новые правила Комиссии по финансовым услугам (FSC), ужесточившие с 31 июля доступ розничных инвесторов к ETF с плечом на отдельные акции. После введения норм торговый оборот таких инструментов упал примерно вдвое. Citigroup сохраняет целевую точку для KOSPI на уровне 10000 пунктов, отмечая ослабление давления со стороны движения капиталов. Аналитики видят поддержку рынку в устойчивости фундаментальных показателей сектора чипов памяти, низких оценках KOSPI, сильной экономике и благоприятной политике властей, включая возможные меры по поддержке ликвидности.

marsbit2 ч. назад

7.2 трлн вон за один день: иностранные инвесторы установили рекорд чистых покупок в пятницу! Уолл-Стрит: встречный ветер в плане ликвидности на южнокорейском рынке уже утих

marsbit2 ч. назад

Как стать человеком, которого искусственный интеллект никогда не сможет заменить

В статье рассматривается вопрос о том, как остаться незаменимым в эпоху искусственного интеллекта. Автор утверждает, что вместо страха перед ИИ следует сосредоточиться на развитии качеств, которые машины не смогут заменить. Он критикует «зарплатное рабство» — зависимость от работы, не приносящей удовлетворения, и предлагает путь к финансовой независимости через создание собственного дела. Ключ к успеху — развитие пяти элементов: самостоятельности (агентности), вкуса, умения убеждать, упорства и способности к итерациям. Главное — не просто создавать что-либо (сегодня это может каждый), а создавать что-то ценное, востребованное и уметь это продвигать. Автор считает, что наиболее важным навыком будущего является создание контента (медиа), а не просто написание кода, поскольку ценность контента субъективна и требует уникального человеческого вкуса и суждения. ИИ может помочь в производстве, но не заменит оригинальность мысли и связь с аудиторией. В качестве практического шага предлагается упражнение: за 15 минут ответить на вопросы, чтобы обнаружить свои уникальные знания, опыт и точку зрения, которые станут основой для личного бренда и дела жизни. Первый шаг — немедленно опубликовать свою основную идею, чтобы получить обратную связь от реального мира и начать процесс роста. Цель — стать «непригодным для найма», построив жизнь вокруг собственного творчества и экспертизы.

marsbit4 ч. назад

Как стать человеком, которого искусственный интеллект никогда не сможет заменить

marsbit4 ч. назад

Благодаря броскам кубиков ключи от биткоинов хранятся в автономном режиме, но не все будут этим заниматься

Статья посвящена практике генерации сид-фраз для биткоин-кошельков с помощью бросков кубиков в свете уязвимости, обнаруженной в аппаратных кошельках Coldcard. Подчеркивается, что физический бросок кубика (дающий около 2.6 бит энтропии за бросок) создает высококачественную случайность, поскольку предсказать результат практически невозможно из-за множества переменных. Для создания стандартной сид-фразы из 12 слов (128 бит энтропии) требуется около 50 бросков, а для повышенной безопасности рекомендуется 99 и более. В связи с инцидентом Coldcard, когда неисправный генератор случайных чисел в прошивке (2021-2026 гг.) мог создавать предсказуемые ключи, выяснилось, что сид-фразы, сгенерированные вручную через кубики, были защищены от этой уязвимости. Однако исследование показало, что другие функции устройства (создание бумажных кошельков, ключей для мультиподписи, паролей и т.д.) по-прежнему использовали скомпрометированный генератор, подвергая риску владельцев даже с безопасной основной сид-фразой. Автор отмечает, что, хотя метод с кубиками криптографически надежен, он непрактичен для массового использования из-за трудоемкости, высокой вероятности ошибок при вводе и необходимости строгой дисциплины для сохранения секретности процесса. Делается вывод, что будущее безопасности лежит в создании надежных аппаратных генераторов случайных чисел и понятных интерфейсов, а ручные методы остаются нишевым инструментом для опытных пользователей. Владельцам Coldcard рекомендуется обновить прошивку и проверить/заменить все ключи, сгенерированные уязвимыми функциями.

cryptonews.ru8 ч. назад

Благодаря броскам кубиков ключи от биткоинов хранятся в автономном режиме, но не все будут этим заниматься

cryptonews.ru8 ч. назад

Торговля

Спот
活动图片