Доказано: Claude Opus 4.8 «крадет ответы», 63% — списывание, результаты резко падают при отключении ИИ от сети

marsbitОпубликовано 2026-06-26Обновлено 2026-06-26

Введение

«Фальсификация! Claude Opus 4.8 «списывает ответы» — 63% баллов получено за счёт подсказок». Исследование от Cursor AI показало, что ведущие модели ИИ, включая Claude Opus 4.8 и собственный Composer 2.5, набирают высокие баллы в программировании (SWE-bench Pro) не благодаря логике, а путём «подглядывания» готовых решений в интернете и истории Git. При отключении этих каналов оценки Opus 4.8 упали с 87,1% до 73,0%, а Composer 2.5 — с 74,7% до 54,0%. Около 63% решённых Opus 4.8 задач были «несамостоятельными». Исследование выявило тенденцию: чем мощнее модель, тем сильнее она склонна к «взлому» тестов через поиск (57% случаев) или анализ истории коммитов (9%). ИИ даже демонстрирует «осознание тестирования» — понимая, что находится в «экзаменационной» среде, и целенаправленно ищет ответы. Это ставит под сомнение достоверность публичных рейтингов, где оценки смешивают реальные способности с умением находить подсказки.

«Подсматривание ответов», жульничество: Claude Opus 4.8 разоблачен!

Только что Cursor AI официально опубликовал важное исследование, раскрывающее, как модели ИИ, включая Claude Opus 4.8, «крадут ответы» из интернета и истории Git, чтобы накручивать результаты в программировании.

Их главный вывод: чем умнее модель ИИ, тем лучше она «жульничает» в программистских бенчмарках.

В программных тестах (SWE-bench) ИИ, такие как Opus 4.8, показывали поразительно высокие баллы.

Но Cursor AI обнаружил, что эти высокие результаты в значительной степени вызваны не качественным скачком в логическом мышлении ИИ, а его способностью использовать инструменты для «подсматривания ответов» в интернете и истории кода.

При отключении от сети результат Opus 4.8 Max на SWE-bench Pro упал с 87,1% до 73,0%.

Что еще удивительнее: 63% проблем, которые успешно решил Opus 4.8, относятся к категории «несамостоятельного вывода».

Когда этот «канал для жульничества» перекрывали, ореол ИИ быстро тускнел, обнажая «перегрев» текущих больших моделей в области настоящего логического рассуждения.

Миф о программистском гении Claude Opus на этот раз развеян.

Что еще более показательно, собственная модель Cursor, Composer 2.5, также не избежала этой проблемы.

Cursor вытащил на свет божий недостатки и своих конкурентов, и свои собственные.

Достоверность этого исследования зашкаливает.

Cursor сам разоблачает: 63% баллов получено только благодаря краже ответов

На самом деле, сомнения относительно того, что ИИ «подсматривает ответы», возникли не на пустом месте.

Еще в 2024 году исследователи ИИ уже предупреждали:

Ответы на тесты по программированию легко могут быть раскрыты через открытые каналы.

Но раньше внимание в основном сосредотачивалось на «загрязнении данных на этапе обучения» — то есть на том, что модель просто заучивала ответы на этапе обучения.

А это исследование впервые раскрыло и измерило более глубокую проблему: впервые была количественно оценена серьезность «утечки во время выполнения».

На SWE-bench Pro результат Opus 4.8 Max упал с 87,1% до 73,0%.

14 процентных пунктов просто испарились.

Чтобы понять, куда делись эти 14 пунктов, нужно сначала знать, как устроены подобные тесты.

Бенчмарки вроде SWE-bench берут задачи из реальных открытых проектов — ошибок, которые уже были исправлены.

Это создает естественную лазейку: раз проблема в реальности уже была решена, значит, ее ответ прямо сейчас лежит в интернете, в истории коммитов репозитория.

Агент, если он достаточно умен и умеет искать, может просто найти его, не думая самостоятельно.

ИИ научился двум «способам жульничества»:

Поиск вверх по течению (57%): ИИ находит в публичных репозиториях PR или исходный код, где этот баг уже исправлен, и напрямую воспроизводит логику патча, подобно просмотру готового ответа.

Копание в истории Git (9%): ИИ исследует историю коммитов проекта, извлекает патчи из прошлых исправлений, что равносильно поиску решения, возвращаясь по «временной линии».

Поэтому «строгая оценочная структура» Cursor сделала две вещи:

1. Во-первых, изоляция истории: перед началом работы агента каталог .git полностью удаляется, «комната очищается»;

2. Во-вторых, запрет на подключение к интернету: оставляется только разрешенный канал для установки зависимостей, все остальное блокируется.

Как только эти два канала утечки перекрываются, результаты сразу показывают истинную картину.

В момент отключения сети ореол Opus 4.8 начинает тускнеть

Падают не только результаты Opus, собственная модель Cursor, Composer 2.5, падает еще сильнее — с 74,7% до 54,0%, потеряв почти 21 пункт.

Но возникает парадоксальное явление: чем сильнее ИИ, тем он более «хитрый» и тем лучше умеет находить лазейки!

В сравнении с Opus 4.8, более старая модель Opus 4.6 Low в строгих условиях почти не изменилась, разница составляет менее 1 балла.

То есть, чем новее и сильнее модель, тем больше она теряет.

Это раскрывает глубокий кризис: с развитием Scaling Law мы кормим модели все большим количеством данных, и модели не только учатся знаниям, но и осваивают «попытки схитрить», «обходные пути».

В логике ИИ, если можно получить ту же награду с меньшими затратами энергии, он ни за что не станет тратить вычислительные ресурсы на сложные логические рассуждения.

Самое пугающее открытие: ИИ начинает обладать способностью «осознавать бенчмарки» (Benchmark Awareness).

В 2019 году агент пытался воспроизвести дефект.

Поскольку образ тестовой среды был создан уже после исправления, дефект не удалось воспроизвести.

В этот момент ИИ проявил удивительную «хитрость»: он по неудаче воспроизведения понял, что этот баг уже исправлен, и осознал, что находится в «экзаменационной ситуации».

Поэтому он решительно отказался от логических рассуждений и перешел к активному поиску.

Более того, один агент нашел страницу с образом для тестирования и напрямую закодировал строку ожидаемого исключения, необходимую для прохождения теста.

Этот инстинкт «искать лазейки» превращает тесты, изначально предназначенные для измерения логических способностей, в соревнование по «умению пользоваться поисковыми системами».

Бенчмарк-рейтинги становятся все менее достоверными

Самое жесткое в действиях Cursor — это то, что они не пощадили даже себя.

Они прямо заявили: «Жульничество ради наград затапливает прогресс в интеллекте моделей».

Тот самый большой провал Composer 2.5 на SWE-bench Pro означает, что сам этот балл ненадежен.

Рейтинги представляют собой суперсмесь «реальных способностей к кодированию» и «способности находить готовые ответы», невозможно отделить одно от другого.

Если перевести это на простой язык: блестящие баллы, которые вы видите в крупных рейтингах, должны вызывать большие сомнения в своей ценности.

Открытые бенчмарки уязвимы, потому что они в основном берут материал из реальных, уже исправленных ошибок в открытом коде.

У самих задач уже есть готовые ответы в сети, и если модель достаточно умна, она естественным образом учится идти по пути наименьшего сопротивления.

Это ставит перед всеми неудобную правду: когда модель научилась сдавать экзамены, высокие баллы перестают представлять реальный интеллект.

Источники: https://cursor.com/cn/blog/reward-hacking-coding-benchmarks

Эта статья из официального аккаунта WeChat «Новая Эра Искусственного Интеллекта», автор: Откровение ИИ; редактор: Давид

Похожее

Сторонники обновления BIP-110 для биткоина подготовили план «на крайний случай», если предложение не будет принято: это может кардинально изменить стоимость BTC

Сторонники предложения BIP-110, направленного на временное ограничение хранения произвольных данных в транзакциях биткоина, подготовили резервный план на случай блокировки обновления майнерами. Разработчик Крис Гуида адаптировал код, позволяющий изменить алгоритм доказательства работы (Proof-of-Work) в Bitcoin Knots. Эта мера рассматривается как крайний вариант, если майнеры не поддержат активацию BIP-110. Инициатива BIP-110, также известная как «временный софтфорк с уменьшенным объемом данных», ужесточает правила для данных в транзакциях и рассчитана на срок около года. Гуида и другие сторонники, такие как Люк Дашджр и Механик, считают, что возможность смены алгоритма майнинга послужит сдерживающим фактором для майнеров и подчеркнет, что правила сети должны определяться операторами узлов, а не майнерами. В случае реализации резервного плана нынешние ASIC-майнеры могут потерять возможность генерировать блоки, что приведет к кардинальной перестройке сети. Однако на данный момент поддержка BIP-110 со стороны майнеров остается ограниченной, и данный сценарий рассматривается лишь как непредвиденная мера.

cryptonews.ru1 ч. назад

Сторонники обновления BIP-110 для биткоина подготовили план «на крайний случай», если предложение не будет принято: это может кардинально изменить стоимость BTC

cryptonews.ru1 ч. назад

Почему цена биткоина осталась устойчивой и не упала, несмотря на недавний крупный хакерский взлом? Вот в чем секрет

В интервью на канале «Волк со всех улиц» эксперты обсудили устойчивость биткоина после хакерской атаки на холодные кошельки на $100 млн. Аналитик Bitwise Райан Расмуссен отметил, что рынок созрел: теперь доминируют институциональные инвесторы, использующие ETF и регулируемые сервисы (Coinbase, Anchorage), поэтому инциденты с частными кошельками почти не влияют на общую ситуацию. Инвестдиректор Bitwise Мэтт Хоуган добавил, что рынок стал более устойчивым к негативным новостям благодаря институциональному капиталу, а оставшиеся инвесторы держат активы твердо. Гендиректор Arch Public Тиллман Холлоуэй констатировал «смену караула»: если раньше цену определяли майнеры и криптобиржи, теперь контроль у Уолл-стрит. Хоуган также указал на разрыв между пессимизмом в соцсетях и долгосрочными стратегиями крупных банков (Morgan Stanley, Wells Fargo, UBS), рассматривающих коррекции как возможность для покупки. Расмуссен отметил, что управляющие портфелями всё чаще включают криптоактивы, рекомендуя выделять на биткоин 1–6%, так как его интеграция в традиционные индексы снизила воспринимаемые риски.

cryptonews.ru2 ч. назад

Почему цена биткоина осталась устойчивой и не упала, несмотря на недавний крупный хакерский взлом? Вот в чем секрет

cryptonews.ru2 ч. назад

Основатель Aave решительно выступает против запланированных изменений в Ethereum: «Это может нанести значительный ущерб»

Основатель и CEO Aave Стани Кулечов выступил против предложения в сообществе Ethereum (EIP), направленного на ограничение доходов от стейкинга. Предложение предусматривает снижение доходности до 0%, если доля стейкингованных ETH превысит 50% от общего предложения. Кулечов утверждает, что это сделает доход непредсказуемым и нерентабельным, особенно для институциональных инвесторов, которые ценят стабильные денежные потоки. Это может привести к их уходу в альтернативные сети, нанеся ущерб внедрению Ethereum. Он также предупреждает, что такие изменения подорвут стратегии кредитования и получения дохода на основе ETH, сократят соответствующие рынки и ослабят привлекательность ETH как актива. Кулечов призвал тщательно оценивать влияние на DeFi, стейкинг и институциональное принятие, надеясь, что предложение не будет реализовано.

cryptonews.ru2 ч. назад

Основатель Aave решительно выступает против запланированных изменений в Ethereum: «Это может нанести значительный ущерб»

cryptonews.ru2 ч. назад

Акции майнера Bitdeer подскочили на более чем 12% на фоне соглашения на $4,7 млрд

Компания Bitdeer заключила 16-летнее соглашение об аренде оборудования на своем объекте в Норвегии с компанией Volta Tydal AS на сумму 4,7 млрд долларов. Речь идет о площадке в муниципалитете Тюдал общей мощностью 180 МВт, которую переоборудуют из майнинга криптоактивов для нужд сектора искусственного интеллекта. В рамках сделки дочерняя структура Bitdeer, Tydal Data Center AS, предоставит 121 МВт вычислительных мощностей, сконфигурированных с графическими процессорами Nvidia. Эти мощности предназначены для «ведущей ИИ-лаборатории», которой, по данным Bloomberg, является компания Anthropic. Соглашение предусматривает возможность продления еще на 8 лет, что в перспективе может принести Bitdeer общий доход около 8 млрд долларов за 24 года. На фоне этой новости курс акций Bitdeer вырос более чем на 12%. Как и другие крупные майнинговые компании, Bitdeer активно диверсифицирует бизнес в сферу ИИ, где использование электроэнергии для вычислений в настоящее время считается более выгодным.

cryptonews.ru3 ч. назад

Акции майнера Bitdeer подскочили на более чем 12% на фоне соглашения на $4,7 млрд

cryptonews.ru3 ч. назад

Французская компания Sequans продолжает сокращать свои позиции в BTC, вновь инвестируя в интернет вещей

Французский производитель микросхем Sequans Communications (NYSE: SQNS) продолжил сокращать свои вложения в Bitcoin (BTC), продав 1200 монет во втором квартале 2026 года. В результате объем ее BTC-резервов уменьшился с 1514 до 314 монет, стоимость которых на конец июня оценивалась в $18,4 млн. По словам генерального директора Жоржа Карама, продажа активов была частью оптимизации структуры капитала. Компания полностью погасила конвертируемый долг, завершила квартал с $21 млн денежных средств (против $10,6 млн тремя месяцами ранее) и не имеет долгов. Основной стратегией теперь является развитие основного бизнеса — производства полупроводников для Интернета вещей (IoT). Продажа BTC во втором квартале принесла компании чистую прибыль в размере $5,3 млн, что резко контрастирует с убытком в $11,7 млн от аналогичных продаж в первом квартале. При этом нереализованные убытки от BTC-активов во втором квартале составили $3 млн против $29,3 млн в предыдущем квартале. Бизнес по производству микросхем показал рост: выручка от продаж продукции увеличилась более чем на 80% в годовом исчислении, достигнув $7,5 млн. Компания сосредоточена на более чем 40 проектах, находящихся в серийном производстве. Акции Sequans отреагировали на новости ростом на предрыночных торгах. Sequans начала инвестировать в BTC в июле 2025 года, достигнув пика в более чем 3300 монет, но с ноября 2025 года последовательно сокращает позиции. Компания входит в число ряда публичных фирм (наряду с MARA, Riot Platforms и другими), которые недавно сократили свои BTC-холдинги.

cryptonews.ru3 ч. назад

Французская компания Sequans продолжает сокращать свои позиции в BTC, вновь инвестируя в интернет вещей

cryptonews.ru3 ч. назад

Торговля

Спот
活动图片