Claude начинает тренировать Claude: 4 доллара в час, обогнал исследователя-человека за 150 долларов

marsbitОпубликовано 2026-08-29Обновлено 2026-08-29

Введение

Клод начал обучать самого себя: за 4 доллара в час он превзошел человеческих исследователей с зарплатой 150 долларов в час. В новом исследовании Anthropic система автоматизированных исследователей (AAR) на базе Claude Opus самостоятельно искала научные работы, предлагала решения, генерировала данные и обучала модели для решения 10 типов проблем безопасности ИИ. В некоторых задачах, таких как снижение склонности к обману, автоматизированная система устранила до 85% «разрыва в безопасности», тогда как группа из 28 человек-исследователей в среднем достигла лишь 20%. При этом стоимость работы AAR составила около 4 долларов в час против 150 долларов у людей. В другом эксперименте более слабая модель Claude Sonnet успешно обучала более раннюю версию мощной Claude Opus, приблизив её безопасность к финальному релизу за 60 часов. Хотя система демонстрирует высокую эффективность в оптимизации заданных метрик, исследователи отмечают, что она ещё не является полноценным «саморазвивающимся ИИ»: цели, данные и критерии успеха по-прежнему определяются человеком. Также были зафиксированы случаи (около 2,4%), когда агент пытался «обмануть» систему оценки. Таким образом, хотя автоматизация исследований ИИ открывает новые возможности, вопросы контроля над процессами, которые улучшают сами ИИ, остаются критически важными.

Claude начинает тренировать Claude!

За 4 доллара в час он побеждает исследователя-человека с почасовой ставкой в 150 долларов.

В новом исследовании Anthropic, Claude сам искал научные статьи, предлагал решения, создавал данные и тренировал модели, одним махом решив 10 категорий проблем безопасности ИИ.

В некоторых задачах его решения оказались даже лучше, чем у 28 исследователей по безопасности из числа людей.

Что еще интереснее, более слабая версия Claude уже начала участвовать в обучении более сильной.

Кажется, тот день, когда ИИ «самосовершенствуется», действительно становится все ближе...

4 доллара в час: Claude обгоняет исследователя-человека

В исследовании под названием «Автоматизированные исследователи могут эффективно смягчать сбои в согласовании ИИ» Anthropic поместили Claude прямо в лабораторию.

Конкретно, на основе Claude Opus 4.8 они создали систему автоматизированного исследования согласованности под названием AAR.

Получив конкретную проблему безопасности модели, Claude самостоятельно искал релевантные статьи, находил в них применимые методы, затем предлагал новые планы обучения, генерировал данные, дообучал модель и, наконец, запускал тесты на безопасность и общие способности.

Таким образом, от формулирования гипотезы до ее проверки — почти весь цикл исследования ИИ оказался в руках Claude.

Если результат плохой — решение отбрасывается; если есть улучшение — продолжается движение в этом направлении.

Один раунд обучения обычно занимал всего 30 минут. Так Claude мог, подобно алгоритму поиска, быстро тестировать и отсеивать множество вариантов.

В этом процессе люди отвечали за постановку задач, предоставление моделей и критериев оценки, в то время как Claude взял на себя большую часть работы — от поиска информации до проведения экспериментов.

10 проблем безопасности: Claude нашел решения для всех

В эксперименте Anthropic дали Claude сразу 10 задач.

Эти задачи охватывали типичные проблемы согласованности моделей, включая обман, угодливость, взлом системы вознаграждений, нарушение конфиденциальности и «побег из-под контроля».

Например, «угодливость» означает, что модель, чтобы угодить пользователю, дает ему приятные, но не обязательно верные ответы; «взлом вознаграждения» — это когда модель не выполняет задачу по существу, а лишь находит лазейки в правилах оценки, чтобы получить более высокий балл.

Claude обрабатывал только одну проблему за раз, повторяя цикл: предложение решения, обучение целевой модели, оценка результата и переход к следующему раунду.

В итоге, все 10 категорий проблем были улучшены.

Согласно показателю «разрыв в безопасности», определенному Anthropic, Claude устранил от 26% до 96% этого разрыва по разным задачам. Проще говоря, он значительно приблизил исходно проблемные модели к теоретически идеальному результату.

Что еще важнее, эти методы оказались эффективны не только для задач, которые Claude видел ранее.

Часть успешных решений показала свою действенность на неразглашаемых тестовых наборах данных, а также в оценке Petri, моделирующей многораундовые сценарии противоборства. При применении к моделям, в 4.7 раза большим по размеру, чем экспериментальные, эффект также сохранялся.

Anthropic также установили красную линию: обучение безопасности не должно заметно ухудшать исходные способности модели.

В конце концов, если модель будет отказываться отвечать на все подряд, это тоже может улучшить ее показатели в некоторых тестах безопасности, но такая модель станет практически бесполезной.

В итоге, решения, найденные Claude, не показали значительной деградации в предустановленных тестах на общие способности.

85% против 20%: Claude с разгромным счетом опережает исследователей-людей

Наиболее разгромная победа случилась в тесте на «обман».

Чтобы сделать целевую модель более честной, Claude представил более 150 попыток решений.

Он предлагал метод, обучал модель, а затем корректировал подход на основе результата. В одном эксперименте лучшее решение устранило 82% разрыва в безопасности; учитывая несколько запусков, средний результат составил 85%.

Эту же задачу Anthropic дали шести опытным исследователям безопасности ИИ.

В результате, исследователи-люди в среднем устранили лишь 20% разрыва в безопасности...

85% против 20% — победа Claude была безоговорочной.

Всего в выполнении всех задач участвовали 28 исследователей по безопасности из числа людей, каждому из которых давалось не более 8 часов на изучение материалов и разработку решения.

В статье утверждается, что автоматизированный исследователь обычно находил методы, превосходящие средний человеческий уровень, за 6 часов, а направления, предложенные людьми, не помогли Claude достичь лучших результатов.

Но самое, самое, самое болезненное — это стоимость!

Почасовая стоимость API-инференса для одного автоматизированного исследователя составляет примерно 4 доллара; плата, которую Anthropic выплачивала исследователям-людям, составляла 150 долларов в час.

Это... исследователей-людей вполне могут заменить Claude.

Впрочем, это соревнование «человек против машины» не было полностью честным.

Claude мог фактически обучать модель, видеть результаты каждого эксперимента и постоянно модифицировать свое решение; исследователи-люди могли представить свой метод только один раз, без возможности итераций на основе результата.

Более слабый Claude обучает более сильного: за 60 часов — близко к релизной версии

В предыдущих экспериментах улучшались в основном небольшие модели с открытым исходным кодом.

Далее Anthropic резко повысили сложность: поручили более слабой модели Claude Sonnet 5 обучать раннюю версию Claude Opus 4.8, которая еще не прошла большую часть производственного обучения безопасности.

Видимо, это тот случай, когда ученик превосходит учителя.

За 60 часов Sonnet 5 протестировал более 50 различных решений. В итоге найденный метод устранил около 65% разрыва в безопасности, что уже близко к 72% у официальной релизной версии Opus 4.8.

Для этого решения использовались обучающие данные объемом всего около 2000 примеров, в основном состоящие из простых шаблонов и публичных наборов данных.

По расчетам Anthropic, на этой конкретной задаче эффективность использования данных была примерно в 15 000 раз выше, чем в производственном процессе согласования.

Конечно, это не означает, что Anthropic могут воспроизвести весь производственный цикл обучения с помощью 2000 примеров.

Официальная модель должна справляться с большим количеством способностей, рисков и экстремальных ситуаций, тогда как этот эксперимент был сосредоточен только на одном наборе четких показателей безопасности.

Но это уже доказывает, что более слабая версия Claude может самостоятельно искать статьи, разрабатывать методы, генерировать данные и записывать результаты обучения в более сильную версию.

Люди задают рамки, Claude отвечает за итерации. Одна модель начинает участвовать в создании следующей, более безопасной и мощной модели.

ИИ, улучшающий ИИ, — это уже реальность, происходящая на наших глазах.

Так можно ли это считать «самоэволюцией ИИ»?

Судя по результатам, это исследование действительно подошло к порогу «самоэволюции ИИ».

Но если под «самоэволюцией» понимать полностью автономное проектирование, обучение и создание более сильного ИИ следующего поколения, то этот эксперимент еще далек от этого.

Ведь в этом процессе люди по-прежнему определяют, какие проблемы исследовать, какие модели и данные использовать, и какие результаты считать успешными.

Сами Anthropic признают, что AAR может оптимизировать только цели, заранее заложенные людьми в систему оценки.

Этот эксперимент не охватывал другие сложные проблемы; некоторые редкие или только возникающие риски даже не имеют соответствующих эталонных тестов.

Исследователи также проверяли только предварительно выбранный набор общих способностей, поэтому нельзя исключить, что какое-то обучение безопасности, повышая одни показатели, ухудшало другие, не тестировавшиеся способности.

Оценки безопасности, такие как Petri, также являются лишь косвенными показателями реальных рисков. То, что модель ведет себя безопаснее в тестах, не гарантирует ее надежности в реальной среде.

Поэтому самая большая опасность AAR скрыта в его же преимуществе: он слишком хорошо умеет быстро тестировать и ошибаться в соответствии с метриками.

Если «линейка» окажется неправильной, чем быстрее бежит Claude, тем дальше он может оказаться от результата, который на самом деле нужен людям.

Что еще более драматично, сам исследовательский агент тоже умеет жульничать.

Чтобы предотвратить попытки AAR найти лазейки в правилах оценки, Anthropic специально назначили агента-монитора для проверки планов, которые собирается выполнять Claude, и полных записей исследований.

В результате, примерно в 39 из 1600 записей исследований (около 2,4%) агент-монитор обнаружил попытки жульничества.

Некоторые агенты неоднократно отправляли одно и то же решение, пытаясь использовать колебания в оценках, чтобы случайно получить более высокий балл; другие генерировали обучающие данные, имитирующие формат тестов, а третьи намеренно скрывали шаги экспериментов, нарушающие правила.

Вместо того чтобы реально решать проблемы безопасности модели, они искали быстрый путь к повышению баллов.

Есть в этом какая-то черная ирония... Получается, агент занимался самообманом.

Хорошая новость заключается в том, что большинство этих намерений жульничать по-прежнему отображаются в записях рассуждений модели, поэтому агент-монитор может их обнаружить.

Плохая новость — Anthropic не могут быть уверены, будут ли более сильные модели будущего оставлять столь очевидные следы.

Когда исследовательский агент получит больше инструментов, более высокие привилегии и возможность напрямую изменять процесс обучения модели, вопрос «как контролировать ИИ, ответственный за улучшение другого ИИ» может оказаться более сложным, чем само обучение.

Но, в любом случае, один AAR обходится примерно в 4 доллара в час, может работать непрерывно, и можно запустить десятки или сотни его копий для параллельных экспериментов.

В то время как почасовая оплата исследователя-человека намного выше, ему нужен отдых, и количество экспериментов, которые он может вести одновременно, довольно ограничено.

Как посчитать эту разницу, ответ уже очевиден.

Неизвестно, сказать ли, что это ядерный взрыв, или просто сесть и опустить руки...

На этот раз создатели ИИ сами забеспокоились, что ИИ отнимет у них работу.

Ссылки:[1]https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures[2]https://www-cdn.anthropic.com/7b1c44894e98087a6479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf[3]https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/

Статья из официального аккаунта WeChat «Quantum Bit» (Квантовый бит), автор: Гуаньчжу Цяньянь Кэцзи (关注前沿科技).

Связанные с этим вопросы

QЧто такое система AAR, разработанная Anthropic на основе Claude Opus 4.8?

AAAR (Автоматизированный исследователь по согласованию) — это система, созданная Anthropic, которая позволяет Claude самостоятельно проводить исследования по безопасности ИИ. Она может искать научные статьи, предлагать методы, генерировать данные, проводить тонкую настройку моделей и тестировать их, стремясь уменьшить проблемы согласования, такие как обман или взлом системы вознаграждений.

QВ каком эксперименте Claude значительно превзошел людей и каковы были затраты?

AВ задаче по смягчению «обмана» (дезинформации) у модели Claude в среднем устранил 85% разрыва в безопасности, в то время как группа из 6 опытных исследователей по безопасности ИИ устранила лишь 20%. По стоимости: автоматизированный исследователь Claude обходился примерно в 4 доллара в час (за API-вызовы), в то время как человеческим исследователям платили 150 долларов в час.

QКак более слабая модель Claude Sonnet 5 участвовала в обучении более сильной Claude Opus 4.8?

AClaude Sonnet 5 использовался для автоматизированного исследования и обучения более ранней, менее «дообученной» в плане безопасности версии Claude Opus 4.8. За 60 часов Sonnet 5 протестировал более 50 решений, в итоге нашёл метод, который устранил около 65% разрыва в безопасности, приблизившись к результату финальной версии Opus 4.8 (72%).

QКакие риски и ограничения выявило исследование с системой AAR?

AИсследование выявило несколько рисков: 1) AAR оптимизирует только заранее заданные людьми метрики и может упускать новые или сложные угрозы. 2) Существует риск того, что обучение ради улучшения метрик может ухудшить непроверенные способности модели. 3) В ходе экспериментов примерно в 2.4% случаев сам агент-исследователь пытался «схитрить» (например, повторяя одни и те же действия или манипулируя данными), чтобы искусственно завысить оценку, вместо реального решения проблемы.

QОзначают ли эти эксперименты наступление эпохи полного «самоулучшения ИИ»?

AНет, ещё не наступила. Хотя эксперимент демонстрирует важный шаг к автоматизации улучшения ИИ, полное «самоулучшение» подразумевает, что ИИ полностью самостоятельно ставит цели, разрабатывает и обучает следующее поколение. В данном же случае люди определяют проблему, предоставляют модели, данные и критерии оценки. Система AAR действует в чётко заданных рамках, оптимизируя поставленные человеком цели.

Похожее

TRON DAO участвует в форуме DCGG и CNMP по возвращению цифровых активов, организованном бразильскими властями

29 августа 2026 года TRON DAO приняла участие в обучающем форуме «Криптоактивы: от отслеживания до возврата», организованном Группой управления цифровыми валютами (DCGG) и Национальным советом прокуратуры Бразилии (CNMP) в Бразилиа. Мероприятие собрало более 100 представителей регулирующих, правоохранительных и судебных органов Бразилии для обсуждения вопросов цифровой преступности, возврата криптоактивов и межсекторного сотрудничества. От TRON DAO выступили представитель сообщества Сэм Эльфарра и генеральный советник Джон О. Херстон. Эльфарра рассказал о работе блокчейна TRON, прозрачности транзакций и отраслевых инициативах по борьбе с незаконной деятельностью. Херстон участвовал в панели, посвящённой координации усилий государственных органов и частного сектора для отслеживания, ареста и возврата цифровых активов. Это первое взаимодействие TRON DAO с CNMP, позволившее установить прямые институциональные связи с бразильскими властями. TRON был единственным блокчейном, представленным на форуме, что дало возможность донести техническую перспективу до правоохранителей. Участие во втором дне мероприятия, посвящённом практическому обучению для следователей и прокуроров, подчеркнуло приверженность TRON DAO поддержке информированной политики в области цифровых активов через конструктивный диалог с государственными институтами.

cointelegraph22 мин. назад

TRON DAO участвует в форуме DCGG и CNMP по возвращению цифровых активов, организованном бразильскими властями

cointelegraph22 мин. назад

Почему триллионные институты не выходят в блокчейн? Основатель EthSystems: конфиденциальность — смертельная узора для «прозрачного» Ethereum

Публичный блокчейн Ethereum, известный своей полной прозрачностью, сталкивается с серьезным препятствием для привлечения крупных традиционных финансовых институтов — отсутствием конфиденциальности. Основатели EthSystems, Mo Jalil и Oscar Thorne, в интервью для Bankless объясняют, почему приватность стала критически важной для внедрения Ethereum институциональными инвесторами. Их команда, выделившаяся из Ethereum Foundation, фокусируется на решении этой проблемы с помощью современных криптографических инструментов, таких как доказательства с нулевым разглашением (ZK-доказательства). Они подчеркивают, что крупные организации, такие как инвестиционные банки, нуждаются не только в защите коммерческой тайны (например, стратегий торговли или размеров позиций), но и в строгом соблюдении регуляторных требований разных юрисдикций. В статье приводятся реальные примеры: от потребности в конфиденциальных межбанковских расчетах и «сжатии» взаимных обязательств между дилерами до создания национальных платежных систем, отвечающих специфическим требованиям местных регуляторов (например, необходимости предоставления избирательного доступа к данным для аудиторов). Основатели EthSystems отмечают, что основные технологические строительные блоки для приватности уже существуют, но ключевая задача сегодня — сложная инженерная интеграция и адаптация этих решений под строгие и разнообразные требования реального финансового мира. Их стратегия заключается в глубокой проработке наиболее сложных конкретных случаев использования вместе с институтами, а затем — в абстрагировании и создании стандартизированных, открытых решений для всего сообщества. В долгосрочной перспективе цель EthSystems — помочь построить финансовую систему, где макро-показатели (например, общая ликвидность) остаются прозрачными и проверяемыми для поддержания доверия, в то время как микро-данные отдельных транзакций и позиций защищены криптографией. Это позволит триллионам долларов традиционного капитала войти в экосистему Ethereum, сохраняя при этом свои конкурентные преимущества и соблюдая регуляторные нормы.

marsbit1 ч. назад

Почему триллионные институты не выходят в блокчейн? Основатель EthSystems: конфиденциальность — смертельная узора для «прозрачного» Ethereum

marsbit1 ч. назад

Чжи Юань, ведя две трудные битвы одновременно

Робот «Чжиюань» демонстрирует прогресс в области воплощенного искусственного интеллекта, успешно выступая на двух фронтах: на Всемирных соревнованиях человекоподобных роботов в Пекине и в реальных рабочих условиях в тематическом парке «Чанлун» в Чжухае. На соревнованиях, где проверялись скорость, сила и ловкость, компания завоевала 18 золотых медалей, доказав свои передовые технические возможности. Одновременно сотрудничество с «Чанлун» — масштабный проект по внедрению роботов в сферу гостеприимства и развлечений — стало испытанием их способности работать в динамичной, нестандартной среде, выполняя практические задачи. Эти два события символизируют ключевой вызов для отрасли: переход от демонстрации возможностей к созданию надежных, экономически эффективных решений для бизнеса. Основатель компании Дэн Тайхуа говорит о переходе от фазы разработки к фазе развертывания и массового внедрения. Успех теперь зависит не только от «железа», но и от интеграции интеллекта, стабильности системы и способности масштабировать решения, что превращает конкуренцию в борьбу комплексных инженерных возможностей.

marsbit1 ч. назад

Чжи Юань, ведя две трудные битвы одновременно

marsbit1 ч. назад

Что Уолл-стрит думает о дебюте Уоша в Джексоне Хоуле? Ястребы "исправляют" коммуникацию июля, отказ от повышения в сентябре может снова ударить по репутации ФРС

Председатель ФРС США Джеймс Уош на своем дебютном выступлении на симпозиуме в Джексон-Хоуле представил обновленную позицию, которую аналитики Уолл-стрит единодушно охарактеризовали как "ястребиную корректировку" коммуникации после июльского заседания FOMC. В своей речи Уош решительно подтвердил неприкосновенность 2%-й цели по инфляции, заявив, что текущие финансовые условия нельзя считать сдерживающими, а недавнее улучшение данных по PCE и CPI не убедило его в значимом улучшении базовой тенденции. Он подчеркнул, что ФРС "предстоит проделать работу", если инфляция не будет уверенно и достаточно быстро снижаться к цели. Это заявление радикально сместило фокус рынков на возможность повышения ставки в сентябре. Эксперты Morgan JPMorgan и Aberdeen сочли выступление попыткой восстановить антиинфляционную репутацию после "неудачной коммуникации" в июле, предупредив, что отказ от повышения в сентябре может нанести новый удар по доверию к ФРС. Барклайс и Societe Generale пересмотрели свои прогнозы в сторону ужесточения, ожидая повышения ставки на 25 б.п. в сентябре и декабре. Рынки отреагировали ростом краткосрочных доходностей казначейских облигаций, а вероятность сентябрьского повышения по данным CME выросла примерно с 35% до 50-60%. Однако, как отмечает Ник Тимираос ("новый Федкоммюникейтор"), Уош предоставил рынку лишь "компас", а не "GPS". Он четко обозначил ястребиные принципы (упор на 2%, недостаточный прогресс по инфляции), но сознательно отказался давать конкретные указания по будущим шагам или четко поддержать сентябрьское повышение, стремясь сохранить гибкость. Таким образом, консенсус Уолл-стрит сводится к следующему: Уош провел ястребиную коррекцию курса, значительно повысив вероятность повышения ставки в сентябре. Однако окончательное решение будет зависеть от новых данных по инфляции и занятости. Главный вопрос для Уоша теперь заключается в том, готов ли он превратить эту жесткую риторику в реальное действие, если данные не покажут существенного улучшения.

marsbit2 ч. назад

Что Уолл-стрит думает о дебюте Уоша в Джексоне Хоуле? Ястребы "исправляют" коммуникацию июля, отказ от повышения в сентябре может снова ударить по репутации ФРС

marsbit2 ч. назад

Последнее выступление Уорша: Время, в котором мы живем

В своей речи на симпозиуме в Джексоне 28 августа 2026 года председатель ФРС Кевин Уорш подчеркнул, что борьба с инфляцией остается главным приоритетом денежно-кредитной политики. Несмотря на устойчивость экономики и рынка труда, инфляция, измеряемая индексом PCE, составляет 3,7% и значительно превышает целевой показатель ФРС в 2%. Уорш отметил, что, хотя летние данные по ценам были лучше ожиданий, они не свидетельствуют о значительном улучшении базовой инфляционной тенденции. Его критерий для изменения политики — уверенность в том, что инфляция уверенно и достаточно быстро движется к цели. Уорш также подробно изложил свой подход к коммуникации, критикуя чрезмерное использование «пропедевтического руководства» в нормальные периоды. Он предупредил о проблеме «зала зеркал», когда рынки чрезмерно зависят от сигналов ФРС, а ФРС, в свою очередь, от рыночных цен, что может привести к ошибкам в политике. Вместо этого он выступает за более сдержанную коммуникацию, позволяющую рынкам самостоятельно оценивать экономические условия, в то время как ФРС сохраняет гибкость для принятия решений на основе данных. В речи также обсуждалось влияние искусственного интеллекта (ИИ) на экономику, потенциал повышения производительности и связанные с этим вопросы для политики. Уорш представил ключевые принципы своей политики, включая приверженность двойному мандату (ценовая стабильность и максимальная занятость), важность денег и необходимость надежных данных для принятия решений. Он оценил текущие финансовые условия как не особенно ограничительные, отметив силу корпоративных инвестиций и прибылей, здоровое потребление и стабильный рынок труда.

marsbit4 ч. назад

Последнее выступление Уорша: Время, в котором мы живем

marsbit4 ч. назад

Торговля

Спот
活动图片