Anthropic приносит извинения, факт скрытого снижения интеллекта Claude подтвержден

marsbitОпубликовано 2026-08-24Обновлено 2026-08-24

Введение

Claude «поумнел»? Разработчики заметили резкое падение производительности модели. Пользователь argofowl обнаружил, что в Claude Code с версии 2.1.237 высокий уровень логического вывода («high») соответствует значению 10, которое раньше обозначало низкий уровень («low»). Оказалось, Anthropic проводит эксперимент по «сжатию шкалы усилий» в рамках A/B-тестирования, о чем не уведомила пользователей. Позже вскрылась и проблема с Opus 5. Пользователи жалуются на снижение качества: модель стала совершать больше ошибок, давать расплывчатые ответы и повторять шаблонные извинения. Инженер Thariq Shihipar от Anthropic подтвердил, что Opus 5 демонстрирует «нестабильную производительность», и пообещал, что решение этой проблемы является наивысшим приоритетом для команды. Эта ситуация подчеркивает ключевое противоречие в индустрии ИИ: великолепные результаты моделей на тестовых стендах (бенчмарках) часто расходятся с субъективным опытом пользователей, которые отмечают ухудшение работы. Обновления крупных языковых моделей часто происходят непрозрачно, без четких изменений в версиях или логов, что подрывает доверие разработчиков, для которых стабильность является критически важной.

Claude за ночь поглупел, весь интернет взорвался!

Именно вчера разработчик argofowl потратил целый день, чуть ли не перевернув Claude Code с ног на голову.

Он последовательно проверял всё: сначала заподозрил сбой t3 code, затем подумал, что в его собственном коде ошибка.

Дойдя до конца, он даже начал сомневаться — неужели он сломал свой Mac?

Когда argofowl наконец открыл реальные логи запросов к API, всё встало на свои места, там чётко было написано число «10».

Однако в бэкенде Claude Code он явно выбрал «high», максимальный уровень рассуждений.

Кто бы мог подумать, что в логах обновлений Claude Code об этом не написано ни слова.

Рассуждения high превратились в 10

Раскрыто оглупление Claude Code

argofowl обнаружил, что начиная с версии Claude Code 2.1.237 модель воспринимает уровень рассуждений «high» как 10 из 100.

Именно это число соответствовало значению старого уровня «low».

При детальном рассмотрении выяснилось, что Anthropic включила сессии Fable 5 в версиях Claude Code 2.1.236 и выше в эксперимент по «сжатию числовой шкалы усилий».

Однако старые версии и Opus 5 не затронуты.

Скорее всего, это A/B-тестирование, поэтому не все с этим столкнутся.

Для разработчиков это настоящая боль. Модель чуть сильнее или слабее — ещё можно пережить.

Но если меня включили в экспериментальную группу и не собираются об этом сообщать: тогда над чем я весь день отлаживаю? Свой код или ваш A/B-тест?

Неожиданно, после репоста техноблогера Chubby, сообщество ИИ взорвалось —

Похоже, Anthropic тихонько сделала модель глупее, никому не сказав.

Мгновенно в X посты с самопроверкой «Claude поглупел?» заполонили ленту.

Кто-то выкладывал сравнение выводов одного и того же промпта в разных версиях, кто-то доставал свои записи сессий двухнедельной давности для построчного сравнения.

Anthropic признаёт ошибку, инженеры вступают в игру

Перед лицом этого шторма ответ инженера Claude Code Thariq Shihipar последовал быстро.

Иногда мы сначала тестируем конфигурации сервисов API в Claude Code, прежде чем решить, выпускать ли их всем.

Текущий эксперимент просто меняет способ отображения числовых значений effort. Поэтому некоторые увидят, что Claude говорит «10».

Ключевой момент: эта шкала не от 0 до 100, это число само по себе не имеет смысла, выбранный вами effort — это тот effort, который вы получаете.

Он подчеркнул, что команда провела глубокое тестирование, чтобы подтвердить, что это не влияет на производительность модели.

Значительное оглупление Opus 5 — это правда

Только разобравшись с проблемой Fable, Chubby прямо заявил, что Opus 5 сейчас ощущается как значительный откат.

Он постоянно отнекивается, допускает элементарные ошибки. Как только ему указывают, что он не выполнил инструкцию, он лишь механически отвечает той самой фразой —

Вы правы, я упустил это. Снова и снова, без конца.

На самом деле, несколько дней назад некоторые уже заметили явную проблему «снижения интеллекта» у Opus 5.

Помимо упомянутых проблем, он также создаёт баги, затем тратит уйму времени на их исправление, в рамках одной задачи постоянно сам себя поправляет.......

После того как пользователи в интернете его засыпали вопросами, инженер Thariq публично признал — Opus 5 — это «крайне нестабильная» модель, то лучше, то хуже, нестабильная.

Внутри команды мы усердно работаем над решением этой проблемы, для нас это наивысший приоритет.

Бенчмарки вечно вверх

Ощущения всё время вниз

Скандал вокруг Opus 5 обнажил самую неловкую трещину во всей индустрии:

Бенчмарки и субъективное восприятие систематически расходятся.

С одной стороны — блестящие, почти безупречные отчёты: общий балл 82.72, SWE-bench Pro 79.2%, Terminal-Bench 86.7%.

С другой — совершенно противоположные реальные ощущения пользователей: «многословный», «ленивый», «любит спорить».

Самое абсурдное в том, что обе оценки относятся к одному и тому же Opus 5.

И проблема «оглупления модели» касается не только Anthropic.

Сегодня обновления версий больших языковых моделей становятся самым непрозрачным чёрным ящиком во всей ИИ-индустрии.

У традиционного ПО есть семантическое версионирование, есть логи изменений, есть механизм отката. Разработчики могут чётко знать, какую версию они используют и какие изменения произошли.

С большими моделями всё иначе.

Под одним и тем же названием модели на стороне сервера в любой момент могут проводиться A/B-тесты, меняться схемы квантования, настройки маршрутизации моделей и даже распределение вычислительных ресурсов.

Единственная приборная панель, которая остаётся у людей, — это их собственные ощущения.

А интуиция — это как раз то, что легче всего отвергнуть и труднее всего опровергнуть.

Главная ценность этого скандала в том, что он вытащил на свет давнюю скрытую проблему индустрии:

Когда модель становится инфраструктурой, стабильность — это договор доверия. Бенчмарки можно использовать для маркетинга, а стабильность можно подтвердить только раз за разом.

Ссылки:

https://x.com/trq212/status/2091252347913773169?s=20

https://x.com/kimmonismus/status/2091178321669198014

Эта статья из WeChat Official Account «Синь Чжи Юань» («Новая эпоха искусственного интеллекта»), автор: ASI启示录, редактор: Таоцзы

Связанные с этим вопросы

QКакой ключевой баг обнаружил разработчик argofowl в Claude Code?

AРазработчик argofowl обнаружил, что начиная с версии Claude Code 2.1.237, модель стала интерпретировать параметр усилия рассуждений «high» (высокий) как значение «10 из 100», хотя ранее это значение соответствовало уровню «low» (низкий). Это происходило в рамках эксперимента Anthropic по сжатию числовой шкалы оценки усилий.

QКак отреагировала компания Anthropic на скандал с Claude Code?

AИнженер Anthropic Тэрик Шихипар оперативно отреагировал. Он объяснил, что это был эксперимент по изменению отображения числовой шкалы параметра «effort» (усилие), который тестировался на части пользователей. Он заявил, что внутреннее тестирование показало, что это изменение не влияет на фактическую производительность модели, а само число 10 в новой шкале не эквивалентно старому значению 10.

QКакие проблемы пользователи обнаружили в модели Opus 5?

AПользователи сообщали, что Opus 5 стал значительно хуже: модель стала давать неполные или неверные ответы, часто повторять шаблонные фразы (например, «Ты прав, это моя ошибка»), создавать в коде новые баги, а затем тратить много времени на их исправление, а также постоянно исправлять саму себя в рамках одного задания. Инженер Thariq признал, что Opus 5 демонстрирует «нестабильную производительность».

QВ чём, согласно статье, заключается основной парадокс современных больших языковых моделей?

AОсновной парадокс заключается в систематическом расхождении между формальными тестовыми показателями (бенчмарками) моделей и субъективным восприятием пользователей. Модели показывают рекордные результаты в синтетических тестах (например, Opus 5 имеет высокие баллы), но пользователи на практике сталкиваются с ухудшением качества: модели становятся более «болтливыми», «ленивыми», склонными к спорам и совершают глупые ошибки.

QКакую ключевую проблему индустрии ИИ высветил этот скандал, по мнению автора статьи?

AСкандал высветил проблему отсутствия прозрачности и контроля при обновлении больших моделей. В отличие от традиционного программного обеспечения с чёткой версионностью и логами изменений, модели на стороне сервера могут незаметно для пользователя подвергаться A/B-тестам, изменениям в квантовании, распределении вычислительных ресурсов и другим модификациям. Это превращает модель в «чёрный ящик», где единственным индикатором для пользователя остаётся его личное, субъективное ощущение, которое трудно доказать.

Похожее

Только что, Олтман раскритиковал Далио за «античеловечность», в тот же день была раскрыта секретная модель

Недавний инцидент в OpenAI привлёк внимание: сотрудник случайно упомянул в GitHub модель под кодовым названием «gpt-nathree», что многие аналитики расценили как указание на скорый выход GPT-6 Astra. Практически одновременно в сообществе Discord были обнаружены ссылки на две новые тестовые модели от Anthropic — «claude-marshmallow-eap» и «claude-melon-eap». На этом фоне генеральный директор OpenAI Сэм Альтман в подкасте «Founders» резко раскритиковал подход некоторых конкурентов, в частности, намекая на компанию Anthropic. Он осудил использование «апокалиптической риторики» в маркетинге как античеловечную, сравнив её с методами диктаторов, и подчеркнул, что централизованный контроль над ИИ представляет серьёзную опасность. Альтман также признал, что ранее ошибся в прогнозах о скорости внедрения ИИ, отметив, что общество адаптируется к технологиям медленнее, чем они развиваются. В интервью Альтман рассказал о ранних днях OpenAI, когда компания более четырёх лет работала без публичного продукта, что противоречит традиционным принципам Кремниевой долины. Он выразил уверенность, что, несмотря на рост возможностей ИИ, подлинная человеческая связь и взаимодействие останутся бесценными, а технологии станут инструментом для новых возможностей, а не заменой человека.

marsbit36 мин. назад

Только что, Олтман раскритиковал Далио за «античеловечность», в тот же день была раскрыта секретная модель

marsbit36 мин. назад

Robinhood Chain вновь в центре внимания, $PONS становится самой дешёвой токен-монетой с высоким доходом

**Краткое содержание:** Согласно данным Blockworks Research, токен Pons ($PONS) за последние 30 дней занимает 13-е место по доходности среди криптотокенов. Однако с коэффициентом FDV/доход всего 0.7x он является токеном с самой низкой оценкой среди 15 лидеров по доходу. Для сравнения, токены, связанные с Pump.fun, имеют мультипликатор около 7.7x, Aave — 45x, а Chainlink — 212x. Pons — это платформа для запуска токенов в сети Robinhood Chain, которую часто сравнивают с "pump.fun". Протокол использует около 80% своего дохода для выкупа и сжигания (burn) токенов $PONS, что уже привело к сокращению общего предложения почти на 30%. Несмотря на впечатляющие данные о доходах и механизм сжигания, рыночная оценка $PONS остается крайне консервативной. Это отражает скептицизм рынка относительно качества и устойчивости доходов платформы, включая возможное влияние накрутки объема торгов. Для пересмотра оценки потребуется время и подтверждение реальной, долгосрочной доходности протокола.

marsbit46 мин. назад

Robinhood Chain вновь в центре внимания, $PONS становится самой дешёвой токен-монетой с высоким доходом

marsbit46 мин. назад

Эстафета «спасения казначейских облигаций США»: Бесант на прошлой неделе провалился, на этой неделе смотрим на Уоша

Министр финансов США Бессент пытался стабилизировать рынок государственных облигаций, удвоив объемы выкупа долгосрочных казначейских облигаций, чтобы снизить растущую доходность на длинном конце кривой. Однако эффект был краткосрочным: доходности вскоре вернулись к высоким уровням, а рынок отреагировал ростом золота и биткоина, что аналитики расценивают как "клапан сброса давления". Теперь внимание обращено к председателю ФРС Уоршу, который выступит на симпозиуме в Джексон-Хоуле. Рынки ждут ясных сигналов о реакции ФРС на инфляцию, сохраняющуюся выше целевого уровня 2%, и ухудшающуюся фискальную динамику. Эксперты предупреждают, что повторение прежней риторики разочарует инвесторов и усилит продажи. Ключевым вопросом является то, сможет ли ФРС, в отличие от казначейства, эффективно заякорить инфляционные ожидания. Обсуждается возможность запуска ФРС аналога "Операции Твист" — продажи краткосрочных и покупки долгосрочных облигаций для снижения долгосрочных ставок без расширения баланса. Перед выступлением Уорша будет опубликован индекс PCE за июль, который может задать тон. Аналитики указывают на уровень доходности 30-летних облигаций в 5% как на критическую точку, преодоление которой усилит давление на доллар и рискованные активы, а также подчеркивают растущую конкуренцию за капитал со стороны корпоративных заимствований и снижение терпимости иностранных инвесторов.

marsbit1 ч. назад

Эстафета «спасения казначейских облигаций США»: Бесант на прошлой неделе провалился, на этой неделе смотрим на Уоша

marsbit1 ч. назад

Путь Hyperliquid к соответствию: от неограниченного доступа к разрешительной системе HIP-3

Гиперликвидный, первоначально функционировавший как децентрализованная платформа для торговли перпетуальными контрактами без разрешений, сталкивается с ключевыми регуляторными препятствиями для выхода на рынок США. Американское законодательство о структуре рынка, требующее регистрации торговых площадок (DCM), клиринговых палат (DCO) и брокеров (FCM), конфликтует с его безотзывной, самохраняемой и глобально доступной инфраструктурой на блокчейне. В ответ Гиперликвидный основал Политический центр (HPC) для лоббирования модернизации правил CFTC и SEC, предлагая рассматривать его слой HyperCore как нейтральную инфраструктуру, которую лицензированные организации могут использовать при соблюдении своих обязанностей (KYC, надзор за рынком). В качестве практического шага к соблюдению требований на тестовой сети был представлен HIP-3 с функцией управления разрешениями. Такие развертывания позволяют регулируемым организациям создавать рынки с белыми списками пользователей, сохраняя при этом контроль. Несмотря на отдельные ордербуки, общая ликвидность и залоговое обеспечение на одном L1 позволяют избежать фрагментации. Этот путь, поддержанный недавними политическими заявлениями, направлен на предоставление американским инвесторам регулируемого доступа к рынкам Гиперликвидного, в то время как его основные рынки остаются открытыми и без разрешений.

marsbit1 ч. назад

Путь Hyperliquid к соответствию: от неограниченного доступа к разрешительной системе HIP-3

marsbit1 ч. назад

Самый важный вопрос политической экономии в эпоху ИИ: как люди будут разделять ценность, когда роботы становятся все более способными?

В статье поднимается ключевой вопрос политической экономии эпохи ИИ: по мере того, как роботы и ИИ становятся все более способными, как человечество будет делиться создаваемой ими стоимостью? В отличие от предыдущих промышленных революций, ИИ впервые заменяет не только физический, но и когнитивный труд, что подрывает традиционную связь между ростом производительности, занятостью и доходами. В мире наблюдается парадокс: технологические гиганты создают огромные богатства (капитализация топ-10 компаний превышает $20 трлн), в то время как доля трудовых доходов в ВВП снижается. Это создает фундаментальное противоречие: производственные возможности растут, но потребительский спрос может отставать из-за проблем с распределением доходов. Автор рассматривает три возможных пути распределения благ в эпоху ИИ: 1) традиционный капитализм (прибыль — акционерам, перераспределение через налоги); 2) государственный капитализм (участие государства в активах ИИ); 3) инновационные механизмы, такие как цифровые суверенные фонды, всеобщее акционерное владение или базовый доход, позволяющие напрямую делиться плодами ИИ со всем обществом. Для Китая, как и для других стран, главный вызов заключается не в замедлении технологического прогресса, а в создании эффективного механизма трансформации производительности ИИ в рост доходов населения, потребления и социального обеспечения. Будущая конкуренция будет определяться не только технологическим превосходством, но и способностью построить новую, справедливую систему распределения, которая обеспечит широкое социальное благосостояние в интеллектуальную эпоху.

marsbit1 ч. назад

Самый важный вопрос политической экономии в эпоху ИИ: как люди будут разделять ценность, когда роботы становятся все более способными?

marsbit1 ч. назад

Торговля

Спот
活动图片