Claude за ночь поглупел, весь интернет взорвался!
Именно вчера разработчик argofowl потратил целый день, чуть ли не перевернув Claude Code с ног на голову.

Он последовательно проверял всё: сначала заподозрил сбой t3 code, затем подумал, что в его собственном коде ошибка.
Дойдя до конца, он даже начал сомневаться — неужели он сломал свой Mac?
Когда argofowl наконец открыл реальные логи запросов к API, всё встало на свои места, там чётко было написано число «10».

Однако в бэкенде Claude Code он явно выбрал «high», максимальный уровень рассуждений.
Кто бы мог подумать, что в логах обновлений Claude Code об этом не написано ни слова.
Рассуждения high превратились в 10
Раскрыто оглупление Claude Code
argofowl обнаружил, что начиная с версии Claude Code 2.1.237 модель воспринимает уровень рассуждений «high» как 10 из 100.
Именно это число соответствовало значению старого уровня «low».
При детальном рассмотрении выяснилось, что Anthropic включила сессии Fable 5 в версиях Claude Code 2.1.236 и выше в эксперимент по «сжатию числовой шкалы усилий».
Однако старые версии и Opus 5 не затронуты.

Скорее всего, это A/B-тестирование, поэтому не все с этим столкнутся.
Для разработчиков это настоящая боль. Модель чуть сильнее или слабее — ещё можно пережить.
Но если меня включили в экспериментальную группу и не собираются об этом сообщать: тогда над чем я весь день отлаживаю? Свой код или ваш A/B-тест?
Неожиданно, после репоста техноблогера Chubby, сообщество ИИ взорвалось —
Похоже, Anthropic тихонько сделала модель глупее, никому не сказав.

Мгновенно в X посты с самопроверкой «Claude поглупел?» заполонили ленту.
Кто-то выкладывал сравнение выводов одного и того же промпта в разных версиях, кто-то доставал свои записи сессий двухнедельной давности для построчного сравнения.
Anthropic признаёт ошибку, инженеры вступают в игру
Перед лицом этого шторма ответ инженера Claude Code Thariq Shihipar последовал быстро.
Иногда мы сначала тестируем конфигурации сервисов API в Claude Code, прежде чем решить, выпускать ли их всем.
Текущий эксперимент просто меняет способ отображения числовых значений effort. Поэтому некоторые увидят, что Claude говорит «10».

Ключевой момент: эта шкала не от 0 до 100, это число само по себе не имеет смысла, выбранный вами effort — это тот effort, который вы получаете.
Он подчеркнул, что команда провела глубокое тестирование, чтобы подтвердить, что это не влияет на производительность модели.

Значительное оглупление Opus 5 — это правда
Только разобравшись с проблемой Fable, Chubby прямо заявил, что Opus 5 сейчас ощущается как значительный откат.
Он постоянно отнекивается, допускает элементарные ошибки. Как только ему указывают, что он не выполнил инструкцию, он лишь механически отвечает той самой фразой —
Вы правы, я упустил это. Снова и снова, без конца.
На самом деле, несколько дней назад некоторые уже заметили явную проблему «снижения интеллекта» у Opus 5.
Помимо упомянутых проблем, он также создаёт баги, затем тратит уйму времени на их исправление, в рамках одной задачи постоянно сам себя поправляет.......


После того как пользователи в интернете его засыпали вопросами, инженер Thariq публично признал — Opus 5 — это «крайне нестабильная» модель, то лучше, то хуже, нестабильная.
Внутри команды мы усердно работаем над решением этой проблемы, для нас это наивысший приоритет.

Бенчмарки вечно вверх
Ощущения всё время вниз
Скандал вокруг Opus 5 обнажил самую неловкую трещину во всей индустрии:
Бенчмарки и субъективное восприятие систематически расходятся.
С одной стороны — блестящие, почти безупречные отчёты: общий балл 82.72, SWE-bench Pro 79.2%, Terminal-Bench 86.7%.
С другой — совершенно противоположные реальные ощущения пользователей: «многословный», «ленивый», «любит спорить».
Самое абсурдное в том, что обе оценки относятся к одному и тому же Opus 5.
И проблема «оглупления модели» касается не только Anthropic.

Сегодня обновления версий больших языковых моделей становятся самым непрозрачным чёрным ящиком во всей ИИ-индустрии.
У традиционного ПО есть семантическое версионирование, есть логи изменений, есть механизм отката. Разработчики могут чётко знать, какую версию они используют и какие изменения произошли.
С большими моделями всё иначе.
Под одним и тем же названием модели на стороне сервера в любой момент могут проводиться A/B-тесты, меняться схемы квантования, настройки маршрутизации моделей и даже распределение вычислительных ресурсов.
Единственная приборная панель, которая остаётся у людей, — это их собственные ощущения.
А интуиция — это как раз то, что легче всего отвергнуть и труднее всего опровергнуть.
Главная ценность этого скандала в том, что он вытащил на свет давнюю скрытую проблему индустрии:
Когда модель становится инфраструктурой, стабильность — это договор доверия. Бенчмарки можно использовать для маркетинга, а стабильность можно подтвердить только раз за разом.
Ссылки:
https://x.com/trq212/status/2091252347913773169?s=20
https://x.com/kimmonismus/status/2091178321669198014
Эта статья из WeChat Official Account «Синь Чжи Юань» («Новая эпоха искусственного интеллекта»), автор: ASI启示录, редактор: Таоцзы





