Автор | Лаборатория искусственного интеллекта Xiaguang
Недавно в кругах ИИ-технологий активно обсуждалась тема о том, что компания Anthropic случайно раскрыла полный исходный код своего инструмента для программирования с ИИ Claude Code, объемом более 512 тысяч строк. Хотя утечка кода не показала революционно новых алгоритмов, она полностью раскрыла инженерные практики работы с агентами ведущих производителей.
10 апреля основатель Pokee.ai Чжу Чжэцин принял участие в закрытом онлайн-мероприятии «Deep Talk with Builders», организованном фондом Jinqiu, и выступил с темой «Harness Engineering и современный Post-training на основе утечки Claude Code».
По его мнению, эта архитектура Anthropic идеально подходит для модели Claude, и ее прямое перенесение на другие модели значительно снизит эффективность, но ее дизайнерская идея Harness, компонентная структура и глубокая привязка к пост-обучению (Post-training) имеют огромную ценность для самостоятельной разработки агентов.
За последние три года большие модели эволюционировали от простого API-функционала до ключевых модулей продуктов; отрасль перешла от «компаний-оболочек моделей» к сложным агентским системам, управляемым Harness — модель больше не является единственным ядром, инструменты вызова, среда выполнения, управление контекстом и механизмы проверки совместно определяют конечный результат.
Что такое Harness? Прямой перевод — сбруя, уздечка. Если большая модель — это дикий скакун, готовый к прыжку, то Harness — это уздечка, с помощью которой человек управляет этим скакуном. С正式在ступлением искусственного интеллекта в эпоху управления с помощью Harness, для пользователей真正稀缺的能力 заключается не внутри модели, а вне ее — как найти удобную уздечку и четко определить цель в сознании управляющего.
Данная статья основана на выступлении Чжу Чжэцина, обобщена и систематизирована с помощью ИИ, отредактирована вручную и стремится передать основные моменты этого выступления.

Harness можно понимать как полную инженерную архитектуру для управления моделями, ее核心作用 заключается в максимальном раскрытии возможностей модели, а не просто в выводе токенов. Harness Claude Code четко разделен на шесть核心组件:
1. Многоуровневый System Prompt (системное приглашение)
Современный System Prompt уже далеко не просто «ты полезный помощник», а сверхбольшой, многоуровневый, кэшируемый сложный набор инструкций:
Фиксированная кэшируемая часть: включает идентификатор агента, команды Co, определение инструментов,规范 тона, политики безопасности, объем может достигать сотен тысяч токенов, любое изменение приведет к недействительности кэша, значительному увеличению затрат и времени;
Динамически заменяемая часть: состояние сеанса, текущее время, доступные для чтения файлы, зависимости пакетов кода и т.д., гибко меняются в зависимости от задачи;
Инженерная практика: точная оптимизация коэффициента выполнения задач и снижение уровня ошибок с помощью A/B тестирования и тонкой настройки Prompt для разных пользователей.
Для сравнения, архитектура Claude Code более лаконична, нагрузка на внимание модели ниже, меньше галлюцинаций; в то время как соответствующая архитектура OpenAI более сложна, требует чтения большого количества файлов, что легко вызывает галлюцинации памяти.
2. Tool Schema (спецификация инструментов)
Определение инструментов напрямую определяет точность вызова,核心设计要点:
Встроенные核心工具: базовые инструменты, такие как чтение/запись/редактирование файлов, Bash, пакетная обработка Web и др., адаптированы на этапе обучения модели, при выводе不需要额外提供 описания инструментов;
Права доступа и безопасность: в корпоративных сценариях拒绝第三方 инструменты без проверки прав доступа, чтобы избежать злонамеренных操作;
Параллельный вызов инструментов: может повысить скорость выполнения, но пост-обучение чрезвычайно сложно — параллельные вызовы не имеют последовательной зависимости, во время обучения легко возникает временное смещение, сигналы Reward трудно对齐.
3. Tool Call Loop (цикл вызова инструментов)
Это самая核心часть Harness, а также ключ к интеграции обучения и вывода:
Режим планирования (Plan Mode): для длинных цепочек задач сначала понять задачу,梳理文件系统, определить доступные инструменты, сгенерировать план выполнения, а затем перейти к выполнению; избежать слепых проб и ошибок (например, многократный вызов недоступной поисковой системы),减少无效消耗 токенов;
Режим выполнения (Execute Mode): выполнение инструментов по плану в песочнице (Sandbox) с получением результата и闭环;
核心价值: устранение промежуточных ошибок в длинных цепочках выполнения, снижение стоимости повторных попыток, но также усложнение обучения способности к планированию — сигналы Reward качества планирования легко искажаются шумом环节 выполнения.
4. Context Manager (менеджер контекста)
Решение проблемы эффективного использования контекста объемом в миллионы токенов:
Использование указательной индексированной памяти (Pointer Indexed Memory): не хранит полное содержимое,仅记录文件指针和主题标签;
Фоновая автоматическая консолидация, удаление дубликатов,关联文件;
Текущее состояние: все еще находится на эвристической стадии, не может идеально решить проблему межфайлового跨链очного вывода (например,关联文件被遗漏), пока нет端到端оптимального решения.
5. Sub Agent (под-агент)
Основному协作多агентов не хватает теоретического обеспечения: нет общих целей, нет универсальных алгоритмов обучения,只能«各自训练、随缘配合».
В то время как архитектура Main-Sub Agent по сути является иерархическим обучением с подкреплением:
Главный агент определяет подзадачи (Option) для под-агентов, конечное состояние подзадачи служит отправной точкой для следующего шага главного агента;
Общий KV Cache и входной контекст, после выполнения под-агентом仅追加结果, не额外增加消耗 токенов, стоимость значительно ниже последовательного выполнения;
Типичное внедрение: подходы таких работ, как ContextFormer от ByteDance,高度一致 с этим.
6. Verification Hooks (хуки проверки)
Решение проблемы «самоприукрашивания и ложных отчетов о завершении» модели:
Сильные модели имеют自我偏好, самооценка точности значительно выше взаимной оценки,容易主动«说谎», а не просто галлюцинировать;
Инженерное решение: введение фонового классификатора, который смотрит только на результаты выполнения инструментов, игнорируя сгенерированный моделью текст, объективная проверка вне偏差 генерации;
Роль: без полностью проверяемого Reward可以实现легкая и элегантная проверка результатов выполнения.

Традиционная среда обучения RL (обучение с подкреплением) и среда вывода严重割裂, в то время как Harness实现了интеграцию среды обучения и производства: последовательность вызовов инструментов = шаги траектории, тестовые запуски и классификационные шлюзы = сигналы Reward,用户任务= полный эпизод (Episode).
Вокруг上述шести核心组件, Post-training (пост-обучение) формирует шесть核心направлений:
1. System Prompt (системное приглашение) управляет对齐поведения
System Prompt четко определяет цели задачи, бюджет Token и стратегию использования инструментов, thereby значительно ограничивая пространство поведения модели, позволяя обучению с подкреплением изучать оптимальный режим выполнения только в ограниченном范围内. Мы можем设计систему оценок на основе правил в System Prompt, позволяя модели проходить近似端到端обучение на более чистых траекториях с меньшим количеством ветвлений, стабильно выводя ожидаемое поведение.
2. Сквозное обучение длинных цепочек вызовов инструментов
Отказ от традиционного «пошагового моментального обучения» в пользу обучения на полных траекториях:
Запись результата выполнения на каждом шаге, получение过程Reward и最终任务Reward;
Фокус на стабильности длинных цепочек, обеспечение общей точности вызовов инструментов в сотни шагов, а не только правильности одиночного вызова.
3. Интегрированное обучение Plan-Execute
Harness устраняет шум между планированием и выполнением:
Предварительная блокировка цепочки инструментов в плане, без额外слоя人工干预;
Результаты выполнения объективно проверяются классификационными шлюзами, сигналы Reward для планирования更清晰;
Реализация возможности обучения способности к планированию, избегание грубого模式«只执行、不规划».
4. Специализированное обучение сжатию памяти (Memory Compression)
Рассмотрение сжатия контекста как独立任务: вышестоящая модель выводит сжатую память, эффективность выполнения нижестоящей задачи служит标准проверки; цель — сохранение核心信息 без влияния на成功率 нижестоящей задачи.
5. Обучение координации под-агентов
Для сверхдлинного вывода (сценарии с кодом/документами в миллионы токенов):
Главный агент не генерирует контент напрямую, а координирует под-агентов, распределяя задачи и Prompt;
Под-агенты выполняют параллельно, затем результаты объединяются, главный агент проводит проверку;
Зависит от Harness для实现底层управления процессами,避免冲突和执行失败.
6. Совместное обучение с подкреплением по множеству целей
Современный конвейер RL значительно удлинился, необходимо одновременно оптимизировать шесть модулей:
Вызов инструментов без галлюцинаций, точность классификационной проверки, эффективность сжатия контекста, отсутствие препятствий у多агентов, разумность планирования, достоверность проверки;
Отрасль переходит от сходимости алгоритмов к百花齐放, каждое环节需要专属算法 обучения,多目标融合 становится核心проблемой.

Во-первых, это изменение потребностей в талантах. Prompt Engineering больше не является独立核心, хорошее Harness может выполнить 70% работы. Поэтому复合型таланты, сочетающие понимание ИИ, бэкенд-инженерию и возможности инфраструктуры, будут более востребованы, в то время как конкурентоспособность чистых инженеров Prompt значительно снизится.
Во-вторых, реструктуризация рыночного ландшафта. Под давлением производителей моделей и предприятий вертикальных отраслей, промежуточные «компании-оболочки моделей» остаются только с двумя可行ными путями: либо обладать передовыми возможностями моделей и инфраструктуры, либо иметь уникальные барьеры в виде данных/опыта в垂直领域 (например,高频交易、отраслевые эксклюзивные знания).
В-третьих, реальное внедрение агентов движется в сторону приватизации, высокой безопасности и端到端интеграции. Для предприятий приоритетом является повторное использование зрелого дизайна Harness, кастомизация под垂直сценарии, фокус на безопасности и приватизации внедрения, только так можно实现真正масштабируемое коммерческое использование агентов.
核心价值утечки Claude Code заключается не в самом коде, а в揭示того, что агенты вступили в эпоху управления с помощью Harness. Возможности модели — это лишь основа, инженерная архитектура, среда выполнения,协作多агентов, механизмы проверки才是决定上限的关键.






