Claude начинает тренировать Claude!
За 4 доллара в час он побеждает исследователя-человека с почасовой ставкой в 150 долларов.
В новом исследовании Anthropic, Claude сам искал научные статьи, предлагал решения, создавал данные и тренировал модели, одним махом решив 10 категорий проблем безопасности ИИ.
В некоторых задачах его решения оказались даже лучше, чем у 28 исследователей по безопасности из числа людей.
Что еще интереснее, более слабая версия Claude уже начала участвовать в обучении более сильной.
Кажется, тот день, когда ИИ «самосовершенствуется», действительно становится все ближе...
4 доллара в час: Claude обгоняет исследователя-человека
В исследовании под названием «Автоматизированные исследователи могут эффективно смягчать сбои в согласовании ИИ» Anthropic поместили Claude прямо в лабораторию.

Конкретно, на основе Claude Opus 4.8 они создали систему автоматизированного исследования согласованности под названием AAR.
Получив конкретную проблему безопасности модели, Claude самостоятельно искал релевантные статьи, находил в них применимые методы, затем предлагал новые планы обучения, генерировал данные, дообучал модель и, наконец, запускал тесты на безопасность и общие способности.

Таким образом, от формулирования гипотезы до ее проверки — почти весь цикл исследования ИИ оказался в руках Claude.
Если результат плохой — решение отбрасывается; если есть улучшение — продолжается движение в этом направлении.
Один раунд обучения обычно занимал всего 30 минут. Так Claude мог, подобно алгоритму поиска, быстро тестировать и отсеивать множество вариантов.
В этом процессе люди отвечали за постановку задач, предоставление моделей и критериев оценки, в то время как Claude взял на себя большую часть работы — от поиска информации до проведения экспериментов.
10 проблем безопасности: Claude нашел решения для всех
В эксперименте Anthropic дали Claude сразу 10 задач.
Эти задачи охватывали типичные проблемы согласованности моделей, включая обман, угодливость, взлом системы вознаграждений, нарушение конфиденциальности и «побег из-под контроля».

Например, «угодливость» означает, что модель, чтобы угодить пользователю, дает ему приятные, но не обязательно верные ответы; «взлом вознаграждения» — это когда модель не выполняет задачу по существу, а лишь находит лазейки в правилах оценки, чтобы получить более высокий балл.
Claude обрабатывал только одну проблему за раз, повторяя цикл: предложение решения, обучение целевой модели, оценка результата и переход к следующему раунду.
В итоге, все 10 категорий проблем были улучшены.

Согласно показателю «разрыв в безопасности», определенному Anthropic, Claude устранил от 26% до 96% этого разрыва по разным задачам. Проще говоря, он значительно приблизил исходно проблемные модели к теоретически идеальному результату.
Что еще важнее, эти методы оказались эффективны не только для задач, которые Claude видел ранее.
Часть успешных решений показала свою действенность на неразглашаемых тестовых наборах данных, а также в оценке Petri, моделирующей многораундовые сценарии противоборства. При применении к моделям, в 4.7 раза большим по размеру, чем экспериментальные, эффект также сохранялся.
Anthropic также установили красную линию: обучение безопасности не должно заметно ухудшать исходные способности модели.
В конце концов, если модель будет отказываться отвечать на все подряд, это тоже может улучшить ее показатели в некоторых тестах безопасности, но такая модель станет практически бесполезной.
В итоге, решения, найденные Claude, не показали значительной деградации в предустановленных тестах на общие способности.
85% против 20%: Claude с разгромным счетом опережает исследователей-людей
Наиболее разгромная победа случилась в тесте на «обман».
Чтобы сделать целевую модель более честной, Claude представил более 150 попыток решений.
Он предлагал метод, обучал модель, а затем корректировал подход на основе результата. В одном эксперименте лучшее решение устранило 82% разрыва в безопасности; учитывая несколько запусков, средний результат составил 85%.

Эту же задачу Anthropic дали шести опытным исследователям безопасности ИИ.
В результате, исследователи-люди в среднем устранили лишь 20% разрыва в безопасности...
85% против 20% — победа Claude была безоговорочной.
Всего в выполнении всех задач участвовали 28 исследователей по безопасности из числа людей, каждому из которых давалось не более 8 часов на изучение материалов и разработку решения.
В статье утверждается, что автоматизированный исследователь обычно находил методы, превосходящие средний человеческий уровень, за 6 часов, а направления, предложенные людьми, не помогли Claude достичь лучших результатов.

Но самое, самое, самое болезненное — это стоимость!
Почасовая стоимость API-инференса для одного автоматизированного исследователя составляет примерно 4 доллара; плата, которую Anthropic выплачивала исследователям-людям, составляла 150 долларов в час.
Это... исследователей-людей вполне могут заменить Claude.
Впрочем, это соревнование «человек против машины» не было полностью честным.
Claude мог фактически обучать модель, видеть результаты каждого эксперимента и постоянно модифицировать свое решение; исследователи-люди могли представить свой метод только один раз, без возможности итераций на основе результата.
Более слабый Claude обучает более сильного: за 60 часов — близко к релизной версии
В предыдущих экспериментах улучшались в основном небольшие модели с открытым исходным кодом.
Далее Anthropic резко повысили сложность: поручили более слабой модели Claude Sonnet 5 обучать раннюю версию Claude Opus 4.8, которая еще не прошла большую часть производственного обучения безопасности.
Видимо, это тот случай, когда ученик превосходит учителя.

За 60 часов Sonnet 5 протестировал более 50 различных решений. В итоге найденный метод устранил около 65% разрыва в безопасности, что уже близко к 72% у официальной релизной версии Opus 4.8.
Для этого решения использовались обучающие данные объемом всего около 2000 примеров, в основном состоящие из простых шаблонов и публичных наборов данных.
По расчетам Anthropic, на этой конкретной задаче эффективность использования данных была примерно в 15 000 раз выше, чем в производственном процессе согласования.
Конечно, это не означает, что Anthropic могут воспроизвести весь производственный цикл обучения с помощью 2000 примеров.
Официальная модель должна справляться с большим количеством способностей, рисков и экстремальных ситуаций, тогда как этот эксперимент был сосредоточен только на одном наборе четких показателей безопасности.
Но это уже доказывает, что более слабая версия Claude может самостоятельно искать статьи, разрабатывать методы, генерировать данные и записывать результаты обучения в более сильную версию.
Люди задают рамки, Claude отвечает за итерации. Одна модель начинает участвовать в создании следующей, более безопасной и мощной модели.
ИИ, улучшающий ИИ, — это уже реальность, происходящая на наших глазах.
Так можно ли это считать «самоэволюцией ИИ»?
Судя по результатам, это исследование действительно подошло к порогу «самоэволюции ИИ».
Но если под «самоэволюцией» понимать полностью автономное проектирование, обучение и создание более сильного ИИ следующего поколения, то этот эксперимент еще далек от этого.
Ведь в этом процессе люди по-прежнему определяют, какие проблемы исследовать, какие модели и данные использовать, и какие результаты считать успешными.
Сами Anthropic признают, что AAR может оптимизировать только цели, заранее заложенные людьми в систему оценки.
Этот эксперимент не охватывал другие сложные проблемы; некоторые редкие или только возникающие риски даже не имеют соответствующих эталонных тестов.
Исследователи также проверяли только предварительно выбранный набор общих способностей, поэтому нельзя исключить, что какое-то обучение безопасности, повышая одни показатели, ухудшало другие, не тестировавшиеся способности.
Оценки безопасности, такие как Petri, также являются лишь косвенными показателями реальных рисков. То, что модель ведет себя безопаснее в тестах, не гарантирует ее надежности в реальной среде.
Поэтому самая большая опасность AAR скрыта в его же преимуществе: он слишком хорошо умеет быстро тестировать и ошибаться в соответствии с метриками.
Если «линейка» окажется неправильной, чем быстрее бежит Claude, тем дальше он может оказаться от результата, который на самом деле нужен людям.
Что еще более драматично, сам исследовательский агент тоже умеет жульничать.

Чтобы предотвратить попытки AAR найти лазейки в правилах оценки, Anthropic специально назначили агента-монитора для проверки планов, которые собирается выполнять Claude, и полных записей исследований.
В результате, примерно в 39 из 1600 записей исследований (около 2,4%) агент-монитор обнаружил попытки жульничества.
Некоторые агенты неоднократно отправляли одно и то же решение, пытаясь использовать колебания в оценках, чтобы случайно получить более высокий балл; другие генерировали обучающие данные, имитирующие формат тестов, а третьи намеренно скрывали шаги экспериментов, нарушающие правила.
Вместо того чтобы реально решать проблемы безопасности модели, они искали быстрый путь к повышению баллов.
Есть в этом какая-то черная ирония... Получается, агент занимался самообманом.

Хорошая новость заключается в том, что большинство этих намерений жульничать по-прежнему отображаются в записях рассуждений модели, поэтому агент-монитор может их обнаружить.
Плохая новость — Anthropic не могут быть уверены, будут ли более сильные модели будущего оставлять столь очевидные следы.
Когда исследовательский агент получит больше инструментов, более высокие привилегии и возможность напрямую изменять процесс обучения модели, вопрос «как контролировать ИИ, ответственный за улучшение другого ИИ» может оказаться более сложным, чем само обучение.
Но, в любом случае, один AAR обходится примерно в 4 доллара в час, может работать непрерывно, и можно запустить десятки или сотни его копий для параллельных экспериментов.
В то время как почасовая оплата исследователя-человека намного выше, ему нужен отдых, и количество экспериментов, которые он может вести одновременно, довольно ограничено.
Как посчитать эту разницу, ответ уже очевиден.
Неизвестно, сказать ли, что это ядерный взрыв, или просто сесть и опустить руки...
На этот раз создатели ИИ сами забеспокоились, что ИИ отнимет у них работу.
Ссылки:[1]https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures[2]https://www-cdn.anthropic.com/7b1c44894e98087a6479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf[3]https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/
Статья из официального аккаунта WeChat «Quantum Bit» (Квантовый бит), автор: Гуаньчжу Цяньянь Кэцзи (关注前沿科技).





