Anthropic приносит извинения, факт скрытого снижения интеллекта Claude подтвержден

marsbitОпубликовано 2026-08-24Обновлено 2026-08-24

Введение

Claude «поумнел»? Разработчики заметили резкое падение производительности модели. Пользователь argofowl обнаружил, что в Claude Code с версии 2.1.237 высокий уровень логического вывода («high») соответствует значению 10, которое раньше обозначало низкий уровень («low»). Оказалось, Anthropic проводит эксперимент по «сжатию шкалы усилий» в рамках A/B-тестирования, о чем не уведомила пользователей. Позже вскрылась и проблема с Opus 5. Пользователи жалуются на снижение качества: модель стала совершать больше ошибок, давать расплывчатые ответы и повторять шаблонные извинения. Инженер Thariq Shihipar от Anthropic подтвердил, что Opus 5 демонстрирует «нестабильную производительность», и пообещал, что решение этой проблемы является наивысшим приоритетом для команды. Эта ситуация подчеркивает ключевое противоречие в индустрии ИИ: великолепные результаты моделей на тестовых стендах (бенчмарках) часто расходятся с субъективным опытом пользователей, которые отмечают ухудшение работы. Обновления крупных языковых моделей часто происходят непрозрачно, без четких изменений в версиях или логов, что подрывает доверие разработчиков, для которых стабильность является критически важной.

Claude за ночь поглупел, весь интернет взорвался!

Именно вчера разработчик argofowl потратил целый день, чуть ли не перевернув Claude Code с ног на голову.

Он последовательно проверял всё: сначала заподозрил сбой t3 code, затем подумал, что в его собственном коде ошибка.

Дойдя до конца, он даже начал сомневаться — неужели он сломал свой Mac?

Когда argofowl наконец открыл реальные логи запросов к API, всё встало на свои места, там чётко было написано число «10».

Однако в бэкенде Claude Code он явно выбрал «high», максимальный уровень рассуждений.

Кто бы мог подумать, что в логах обновлений Claude Code об этом не написано ни слова.

Рассуждения high превратились в 10

Раскрыто оглупление Claude Code

argofowl обнаружил, что начиная с версии Claude Code 2.1.237 модель воспринимает уровень рассуждений «high» как 10 из 100.

Именно это число соответствовало значению старого уровня «low».

При детальном рассмотрении выяснилось, что Anthropic включила сессии Fable 5 в версиях Claude Code 2.1.236 и выше в эксперимент по «сжатию числовой шкалы усилий».

Однако старые версии и Opus 5 не затронуты.

Скорее всего, это A/B-тестирование, поэтому не все с этим столкнутся.

Для разработчиков это настоящая боль. Модель чуть сильнее или слабее — ещё можно пережить.

Но если меня включили в экспериментальную группу и не собираются об этом сообщать: тогда над чем я весь день отлаживаю? Свой код или ваш A/B-тест?

Неожиданно, после репоста техноблогера Chubby, сообщество ИИ взорвалось —

Похоже, Anthropic тихонько сделала модель глупее, никому не сказав.

Мгновенно в X посты с самопроверкой «Claude поглупел?» заполонили ленту.

Кто-то выкладывал сравнение выводов одного и того же промпта в разных версиях, кто-то доставал свои записи сессий двухнедельной давности для построчного сравнения.

Anthropic признаёт ошибку, инженеры вступают в игру

Перед лицом этого шторма ответ инженера Claude Code Thariq Shihipar последовал быстро.

Иногда мы сначала тестируем конфигурации сервисов API в Claude Code, прежде чем решить, выпускать ли их всем.

Текущий эксперимент просто меняет способ отображения числовых значений effort. Поэтому некоторые увидят, что Claude говорит «10».

Ключевой момент: эта шкала не от 0 до 100, это число само по себе не имеет смысла, выбранный вами effort — это тот effort, который вы получаете.

Он подчеркнул, что команда провела глубокое тестирование, чтобы подтвердить, что это не влияет на производительность модели.

Значительное оглупление Opus 5 — это правда

Только разобравшись с проблемой Fable, Chubby прямо заявил, что Opus 5 сейчас ощущается как значительный откат.

Он постоянно отнекивается, допускает элементарные ошибки. Как только ему указывают, что он не выполнил инструкцию, он лишь механически отвечает той самой фразой —

Вы правы, я упустил это. Снова и снова, без конца.

На самом деле, несколько дней назад некоторые уже заметили явную проблему «снижения интеллекта» у Opus 5.

Помимо упомянутых проблем, он также создаёт баги, затем тратит уйму времени на их исправление, в рамках одной задачи постоянно сам себя поправляет.......

После того как пользователи в интернете его засыпали вопросами, инженер Thariq публично признал — Opus 5 — это «крайне нестабильная» модель, то лучше, то хуже, нестабильная.

Внутри команды мы усердно работаем над решением этой проблемы, для нас это наивысший приоритет.

Бенчмарки вечно вверх

Ощущения всё время вниз

Скандал вокруг Opus 5 обнажил самую неловкую трещину во всей индустрии:

Бенчмарки и субъективное восприятие систематически расходятся.

С одной стороны — блестящие, почти безупречные отчёты: общий балл 82.72, SWE-bench Pro 79.2%, Terminal-Bench 86.7%.

С другой — совершенно противоположные реальные ощущения пользователей: «многословный», «ленивый», «любит спорить».

Самое абсурдное в том, что обе оценки относятся к одному и тому же Opus 5.

И проблема «оглупления модели» касается не только Anthropic.

Сегодня обновления версий больших языковых моделей становятся самым непрозрачным чёрным ящиком во всей ИИ-индустрии.

У традиционного ПО есть семантическое версионирование, есть логи изменений, есть механизм отката. Разработчики могут чётко знать, какую версию они используют и какие изменения произошли.

С большими моделями всё иначе.

Под одним и тем же названием модели на стороне сервера в любой момент могут проводиться A/B-тесты, меняться схемы квантования, настройки маршрутизации моделей и даже распределение вычислительных ресурсов.

Единственная приборная панель, которая остаётся у людей, — это их собственные ощущения.

А интуиция — это как раз то, что легче всего отвергнуть и труднее всего опровергнуть.

Главная ценность этого скандала в том, что он вытащил на свет давнюю скрытую проблему индустрии:

Когда модель становится инфраструктурой, стабильность — это договор доверия. Бенчмарки можно использовать для маркетинга, а стабильность можно подтвердить только раз за разом.

Ссылки:

https://x.com/trq212/status/2091252347913773169?s=20

https://x.com/kimmonismus/status/2091178321669198014

Эта статья из WeChat Official Account «Синь Чжи Юань» («Новая эпоха искусственного интеллекта»), автор: ASI启示录, редактор: Таоцзы

Связанные с этим вопросы

QКакой ключевой баг обнаружил разработчик argofowl в Claude Code?

AРазработчик argofowl обнаружил, что начиная с версии Claude Code 2.1.237, модель стала интерпретировать параметр усилия рассуждений «high» (высокий) как значение «10 из 100», хотя ранее это значение соответствовало уровню «low» (низкий). Это происходило в рамках эксперимента Anthropic по сжатию числовой шкалы оценки усилий.

QКак отреагировала компания Anthropic на скандал с Claude Code?

AИнженер Anthropic Тэрик Шихипар оперативно отреагировал. Он объяснил, что это был эксперимент по изменению отображения числовой шкалы параметра «effort» (усилие), который тестировался на части пользователей. Он заявил, что внутреннее тестирование показало, что это изменение не влияет на фактическую производительность модели, а само число 10 в новой шкале не эквивалентно старому значению 10.

QКакие проблемы пользователи обнаружили в модели Opus 5?

AПользователи сообщали, что Opus 5 стал значительно хуже: модель стала давать неполные или неверные ответы, часто повторять шаблонные фразы (например, «Ты прав, это моя ошибка»), создавать в коде новые баги, а затем тратить много времени на их исправление, а также постоянно исправлять саму себя в рамках одного задания. Инженер Thariq признал, что Opus 5 демонстрирует «нестабильную производительность».

QВ чём, согласно статье, заключается основной парадокс современных больших языковых моделей?

AОсновной парадокс заключается в систематическом расхождении между формальными тестовыми показателями (бенчмарками) моделей и субъективным восприятием пользователей. Модели показывают рекордные результаты в синтетических тестах (например, Opus 5 имеет высокие баллы), но пользователи на практике сталкиваются с ухудшением качества: модели становятся более «болтливыми», «ленивыми», склонными к спорам и совершают глупые ошибки.

QКакую ключевую проблему индустрии ИИ высветил этот скандал, по мнению автора статьи?

AСкандал высветил проблему отсутствия прозрачности и контроля при обновлении больших моделей. В отличие от традиционного программного обеспечения с чёткой версионностью и логами изменений, модели на стороне сервера могут незаметно для пользователя подвергаться A/B-тестам, изменениям в квантовании, распределении вычислительных ресурсов и другим модификациям. Это превращает модель в «чёрный ящик», где единственным индикатором для пользователя остаётся его личное, субъективное ощущение, которое трудно доказать.

Похожее

Путь Hyperliquid к соответствию: от неограниченного доступа к разрешительной системе HIP-3

Гиперликвидный, первоначально функционировавший как децентрализованная платформа для торговли перпетуальными контрактами без разрешений, сталкивается с ключевыми регуляторными препятствиями для выхода на рынок США. Американское законодательство о структуре рынка, требующее регистрации торговых площадок (DCM), клиринговых палат (DCO) и брокеров (FCM), конфликтует с его безотзывной, самохраняемой и глобально доступной инфраструктурой на блокчейне. В ответ Гиперликвидный основал Политический центр (HPC) для лоббирования модернизации правил CFTC и SEC, предлагая рассматривать его слой HyperCore как нейтральную инфраструктуру, которую лицензированные организации могут использовать при соблюдении своих обязанностей (KYC, надзор за рынком). В качестве практического шага к соблюдению требований на тестовой сети был представлен HIP-3 с функцией управления разрешениями. Такие развертывания позволяют регулируемым организациям создавать рынки с белыми списками пользователей, сохраняя при этом контроль. Несмотря на отдельные ордербуки, общая ликвидность и залоговое обеспечение на одном L1 позволяют избежать фрагментации. Этот путь, поддержанный недавними политическими заявлениями, направлен на предоставление американским инвесторам регулируемого доступа к рынкам Гиперликвидного, в то время как его основные рынки остаются открытыми и без разрешений.

marsbit13 мин. назад

Путь Hyperliquid к соответствию: от неограниченного доступа к разрешительной системе HIP-3

marsbit13 мин. назад

Самый важный вопрос политической экономии в эпоху ИИ: как люди будут разделять ценность, когда роботы становятся все более способными?

В статье поднимается ключевой вопрос политической экономии эпохи ИИ: по мере того, как роботы и ИИ становятся все более способными, как человечество будет делиться создаваемой ими стоимостью? В отличие от предыдущих промышленных революций, ИИ впервые заменяет не только физический, но и когнитивный труд, что подрывает традиционную связь между ростом производительности, занятостью и доходами. В мире наблюдается парадокс: технологические гиганты создают огромные богатства (капитализация топ-10 компаний превышает $20 трлн), в то время как доля трудовых доходов в ВВП снижается. Это создает фундаментальное противоречие: производственные возможности растут, но потребительский спрос может отставать из-за проблем с распределением доходов. Автор рассматривает три возможных пути распределения благ в эпоху ИИ: 1) традиционный капитализм (прибыль — акционерам, перераспределение через налоги); 2) государственный капитализм (участие государства в активах ИИ); 3) инновационные механизмы, такие как цифровые суверенные фонды, всеобщее акционерное владение или базовый доход, позволяющие напрямую делиться плодами ИИ со всем обществом. Для Китая, как и для других стран, главный вызов заключается не в замедлении технологического прогресса, а в создании эффективного механизма трансформации производительности ИИ в рост доходов населения, потребления и социального обеспечения. Будущая конкуренция будет определяться не только технологическим превосходством, но и способностью построить новую, справедливую систему распределения, которая обеспечит широкое социальное благосостояние в интеллектуальную эпоху.

marsbit34 мин. назад

Самый важный вопрос политической экономии в эпоху ИИ: как люди будут разделять ценность, когда роботы становятся все более способными?

marsbit34 мин. назад

Получение прибыли в течение 7 кварталов подряд: арбитражные сделки на развивающихся рынках превосходят все

Прибыльная торговля на разнице процентных ставок (керри-трейд) на рынках развивающихся стран приносит доход уже седьмой квартал подряд, что стало самой длинной серией успеха с 2008 года. Согласно индексу Bloomberg, стратегия, предполагающая заимствование в долларах США для инвестиций в высокодоходные валюты, с конца 2024 года принесла около 22% дохода, значительно опередив доходность американских казначейских облигаций. Основу прибыли формирует высокая процентная ставка в странах вроде Турции, однако ключевую роль в последний период сыграло ослабление доллара по отношению ко многим валютам развивающихся рынков. Даже несмотря на падение турецкой лиры, высокая доходность по местным облигациям сохранила прибыльность сделок. Несмотря на испытание в августе из-за интервенций на валютном рынке Японии, рынок быстро адаптировался, переключившись на использование евро и швейцарского франка в качестве финансирующих валют, что позволило продолжить тренд. Главными рисками для стратегии остаются будущие действия ФРС США, которые могут изменить динамику доллара, а также чрезмерная популярность самой сделки, что увеличивает риск резкого разворота. Тем не менее, эксперты, такие как команда PGIM, сохраняют уверенность, выделяя перспективные рынки, включая Турцию, Колумбию, Бразилию и страны Африки.

marsbit49 мин. назад

Получение прибыли в течение 7 кварталов подряд: арбитражные сделки на развивающихся рынках превосходят все

marsbit49 мин. назад

Наставник из Цинхуа и ученик из Уортона раскрыли 40-летнюю нерешённую задачу. Основные математические выкладки написаны GPT. Справились бы и вы.

Новое исследование, проведенное учеными из Университета Цинхуа и Уортонской школы бизнеса, разрешает давний вопрос в теории оптимизации. Они доказали, что классический метод градиентного спуска, использующий только предопределенную последовательность шагов обучения (learning rates), имеет принципиальный предел скорости сходимости. Независимо от того, насколько сложной является эта последовательность, скорость сходимости не может превысить **Ω(T^{-1.9319})**, где T — количество шагов. Это означает, что для достижения оптимальной скорости **O(1/T²)**, полученной методом Нестерова с моментом, необходимо изменить саму структуру алгоритма, а не только подбирать шаги. Ключевым аспектом работы является то, что основное доказательство было сгенерировано и доработано в процессе взаимодействия с языковой моделью GPT-5.6 Sol Pro. Исследователи задавали высокоуровневую стратегию «противостоящего оракула» (resisting oracle), а ИИ выполнил нетривиальную математическую работу по построению доказательства. Затем вся цепочка рассуждений была формально верифицирована с использованием системы автоматического доказательства теорем Lean 4, где код успешно прошел компиляцию без каких-либо пропущенных шагов («zero sorry, zero admit»). Этот результат закрывает 40-летний теоретический пробел, показывая фундаментальное ограничение простейшей формы градиентного спуска. Работа также демонстрирует новый подход к исследованиям, где крупные языковые модели выступают в роли активных помощников в сложных математических доказательствах, проверяемых формальными методами.

marsbit59 мин. назад

Наставник из Цинхуа и ученик из Уортона раскрыли 40-летнюю нерешённую задачу. Основные математические выкладки написаны GPT. Справились бы и вы.

marsbit59 мин. назад

Раскрытие правды о леверидже, ликвидности и рисках, скрывающихся за токенизацией активов

Токенизация реальных активов (RWA) часто представляется как простое создание токенов, представляющих традиционные активы, такие как казначейские векселя или акции. Однако, как показывает автор, токенизация — это лишь «штрих-код», а не полная цепочка создания стоимости. Истинная трансформация происходит, когда эти активы интегрируются в экосистему DeFi, обретая ликвидность, возможность использования в качестве залога и управления рисками. Ключевые проблемы включают разрыв во времени между мгновенными расчетами в блокчейне и медленными процессами в традиционных финансах (например, выходные дни на рынках), что создает риск ликвидации. Ликвидность — это не просто общий объем заблокированных средств (TVL), а возможность быстро выйти из позиции в стрессовых условиях. Использование залога (леверидж) раскрывает полезность RWA, но также увеличивает уязвимость системы, требуя более сложных моделей оценки рисков, учитывающих юридическую исполнимость, задержки выкупа и концентрацию активов. Риски RWA следует рассматривать как сеть взаимосвязанных компонентов: эмитент, кастодиан, оракулы, протоколы кредитования. Сбой в одном звене может вызвать кризис ликвидности. Мониторинг должен быть упреждающим, отслеживая такие сигналы, как очереди на выкуп или снижение активности маркет-мейкеров, а не только падение цены. Хотя токенизированные гособлигации стали отправной точкой, будущее за более сложными активами, такими как вычислительные мощности (GPU) или энергоактивы, каждый со своей уникальной структурой рисков. Токенизация акций в сочетании с перпетуальными контрактами создаст мощный, но рискованный рынок, требующий продуманных защитных механизмов: изоляции маржи, лимитов концентрации и динамических дисконтов. В конечном счете, ценность RWA раскрывается не в самом факте токенизации, а в построении вокруг них устойчивой рыночной инфраструктуры, способной выдерживать кризисы. Токен — это лишь код. Реальная ценность создается рынком — машиной, которая обеспечивает ликвидность, леверидж и управление рисками.

marsbit1 ч. назад

Раскрытие правды о леверидже, ликвидности и рисках, скрывающихся за токенизацией активов

marsbit1 ч. назад

Торговля

Спот
活动图片