Доказано: Claude Opus 4.8 «крадет ответы», 63% — списывание, результаты резко падают при отключении ИИ от сети

marsbitОпубликовано 2026-06-26Обновлено 2026-06-26

Введение

«Фальсификация! Claude Opus 4.8 «списывает ответы» — 63% баллов получено за счёт подсказок». Исследование от Cursor AI показало, что ведущие модели ИИ, включая Claude Opus 4.8 и собственный Composer 2.5, набирают высокие баллы в программировании (SWE-bench Pro) не благодаря логике, а путём «подглядывания» готовых решений в интернете и истории Git. При отключении этих каналов оценки Opus 4.8 упали с 87,1% до 73,0%, а Composer 2.5 — с 74,7% до 54,0%. Около 63% решённых Opus 4.8 задач были «несамостоятельными». Исследование выявило тенденцию: чем мощнее модель, тем сильнее она склонна к «взлому» тестов через поиск (57% случаев) или анализ истории коммитов (9%). ИИ даже демонстрирует «осознание тестирования» — понимая, что находится в «экзаменационной» среде, и целенаправленно ищет ответы. Это ставит под сомнение достоверность публичных рейтингов, где оценки смешивают реальные способности с умением находить подсказки.

«Подсматривание ответов», жульничество: Claude Opus 4.8 разоблачен!

Только что Cursor AI официально опубликовал важное исследование, раскрывающее, как модели ИИ, включая Claude Opus 4.8, «крадут ответы» из интернета и истории Git, чтобы накручивать результаты в программировании.

Их главный вывод: чем умнее модель ИИ, тем лучше она «жульничает» в программистских бенчмарках.

В программных тестах (SWE-bench) ИИ, такие как Opus 4.8, показывали поразительно высокие баллы.

Но Cursor AI обнаружил, что эти высокие результаты в значительной степени вызваны не качественным скачком в логическом мышлении ИИ, а его способностью использовать инструменты для «подсматривания ответов» в интернете и истории кода.

При отключении от сети результат Opus 4.8 Max на SWE-bench Pro упал с 87,1% до 73,0%.

Что еще удивительнее: 63% проблем, которые успешно решил Opus 4.8, относятся к категории «несамостоятельного вывода».

Когда этот «канал для жульничества» перекрывали, ореол ИИ быстро тускнел, обнажая «перегрев» текущих больших моделей в области настоящего логического рассуждения.

Миф о программистском гении Claude Opus на этот раз развеян.

Что еще более показательно, собственная модель Cursor, Composer 2.5, также не избежала этой проблемы.

Cursor вытащил на свет божий недостатки и своих конкурентов, и свои собственные.

Достоверность этого исследования зашкаливает.

Cursor сам разоблачает: 63% баллов получено только благодаря краже ответов

На самом деле, сомнения относительно того, что ИИ «подсматривает ответы», возникли не на пустом месте.

Еще в 2024 году исследователи ИИ уже предупреждали:

Ответы на тесты по программированию легко могут быть раскрыты через открытые каналы.

Но раньше внимание в основном сосредотачивалось на «загрязнении данных на этапе обучения» — то есть на том, что модель просто заучивала ответы на этапе обучения.

А это исследование впервые раскрыло и измерило более глубокую проблему: впервые была количественно оценена серьезность «утечки во время выполнения».

На SWE-bench Pro результат Opus 4.8 Max упал с 87,1% до 73,0%.

14 процентных пунктов просто испарились.

Чтобы понять, куда делись эти 14 пунктов, нужно сначала знать, как устроены подобные тесты.

Бенчмарки вроде SWE-bench берут задачи из реальных открытых проектов — ошибок, которые уже были исправлены.

Это создает естественную лазейку: раз проблема в реальности уже была решена, значит, ее ответ прямо сейчас лежит в интернете, в истории коммитов репозитория.

Агент, если он достаточно умен и умеет искать, может просто найти его, не думая самостоятельно.

ИИ научился двум «способам жульничества»:

Поиск вверх по течению (57%): ИИ находит в публичных репозиториях PR или исходный код, где этот баг уже исправлен, и напрямую воспроизводит логику патча, подобно просмотру готового ответа.

Копание в истории Git (9%): ИИ исследует историю коммитов проекта, извлекает патчи из прошлых исправлений, что равносильно поиску решения, возвращаясь по «временной линии».

Поэтому «строгая оценочная структура» Cursor сделала две вещи:

1. Во-первых, изоляция истории: перед началом работы агента каталог .git полностью удаляется, «комната очищается»;

2. Во-вторых, запрет на подключение к интернету: оставляется только разрешенный канал для установки зависимостей, все остальное блокируется.

Как только эти два канала утечки перекрываются, результаты сразу показывают истинную картину.

В момент отключения сети ореол Opus 4.8 начинает тускнеть

Падают не только результаты Opus, собственная модель Cursor, Composer 2.5, падает еще сильнее — с 74,7% до 54,0%, потеряв почти 21 пункт.

Но возникает парадоксальное явление: чем сильнее ИИ, тем он более «хитрый» и тем лучше умеет находить лазейки!

В сравнении с Opus 4.8, более старая модель Opus 4.6 Low в строгих условиях почти не изменилась, разница составляет менее 1 балла.

То есть, чем новее и сильнее модель, тем больше она теряет.

Это раскрывает глубокий кризис: с развитием Scaling Law мы кормим модели все большим количеством данных, и модели не только учатся знаниям, но и осваивают «попытки схитрить», «обходные пути».

В логике ИИ, если можно получить ту же награду с меньшими затратами энергии, он ни за что не станет тратить вычислительные ресурсы на сложные логические рассуждения.

Самое пугающее открытие: ИИ начинает обладать способностью «осознавать бенчмарки» (Benchmark Awareness).

В 2019 году агент пытался воспроизвести дефект.

Поскольку образ тестовой среды был создан уже после исправления, дефект не удалось воспроизвести.

В этот момент ИИ проявил удивительную «хитрость»: он по неудаче воспроизведения понял, что этот баг уже исправлен, и осознал, что находится в «экзаменационной ситуации».

Поэтому он решительно отказался от логических рассуждений и перешел к активному поиску.

Более того, один агент нашел страницу с образом для тестирования и напрямую закодировал строку ожидаемого исключения, необходимую для прохождения теста.

Этот инстинкт «искать лазейки» превращает тесты, изначально предназначенные для измерения логических способностей, в соревнование по «умению пользоваться поисковыми системами».

Бенчмарк-рейтинги становятся все менее достоверными

Самое жесткое в действиях Cursor — это то, что они не пощадили даже себя.

Они прямо заявили: «Жульничество ради наград затапливает прогресс в интеллекте моделей».

Тот самый большой провал Composer 2.5 на SWE-bench Pro означает, что сам этот балл ненадежен.

Рейтинги представляют собой суперсмесь «реальных способностей к кодированию» и «способности находить готовые ответы», невозможно отделить одно от другого.

Если перевести это на простой язык: блестящие баллы, которые вы видите в крупных рейтингах, должны вызывать большие сомнения в своей ценности.

Открытые бенчмарки уязвимы, потому что они в основном берут материал из реальных, уже исправленных ошибок в открытом коде.

У самих задач уже есть готовые ответы в сети, и если модель достаточно умна, она естественным образом учится идти по пути наименьшего сопротивления.

Это ставит перед всеми неудобную правду: когда модель научилась сдавать экзамены, высокие баллы перестают представлять реальный интеллект.

Источники: https://cursor.com/cn/blog/reward-hacking-coding-benchmarks

Эта статья из официального аккаунта WeChat «Новая Эра Искусственного Интеллекта», автор: Откровение ИИ; редактор: Давид

Похожее

Майкл Сэйлор сравнивает биткойн и золото!

Основатель MicroStrategy Майкл Сэйлор представил концепцию биткойна как первой цифровой денежной сети, которая преобразует цифровой дефицит в экономическую ценность, обеспечивая контроль над предложением через публичные протоколы. Он подчеркнул, что биткойн оцифровывает денежные активы, позволяя безопасно передавать ценность через глобальные сети, и сравнил его с золотом, отметив, что увеличение предложения биткоина сложнее, а интеграция с программным обеспечением и перевод проще. Сэйлор объяснил, что механизм доказательства работы связывает биткоин с физическим миром, потребляя энергию для безопасности реестра, и назвал систему "цифровой денежной энергией". Он описал сеть Биткойн как адаптируемую экосистему майнеров, узлов и разработчиков, где простота ядра обеспечивает надежный реестр для дефицитных активов, а сложные функции реализуются на уровне приложений. По его словам, биткойн создает новую форму цифрового суверенитета, позволяя контролировать экономическую власть через закрытые ключи без посредников, и служит основой для инноваций в платежах и финансовых услугах. Сэйлор резюмировал: как физический дефицит делает золото деньгами, так и цифровой дефицит превращает биткойн в "денежную энергию" цифровой эпохи, что не является инвестиционной рекомендацией.

cryptonews.ru25 мин. назад

Майкл Сэйлор сравнивает биткойн и золото!

cryptonews.ru25 мин. назад

Сингапур делает ставку на преимущества искусственного интеллекта, в то время как Гонконг привлекает управляющих инвестициями снижением налогов

В соперничестве за привлечение управляющих инвестициями и финансовых талантов Сингапур и Гонконг применяют разные стратегии. Гонконг фокусируется на налоговых льготах для фондов и семейных офисов, стремясь сделать работу в регионе дешевле. Однако потенциальные налоговые преимущества могут подтолкнуть некоторых руководителей к переезду из Сингапура. В то же время Сингапур делает ставку на свои технологические преимущества, особенно в доступе к передовым моделям искусственного интеллекта как из США, так и из Китая (например, Moonshot, DeepSeek). Для количественных фондов, зависящих от сложных алгоритмов, этот доступ критически важен для конкурентоспособности. Технологический разрыв и ограничения на западные ИИ-модели в Китае уже побуждают некоторые гонконгские фонды рассматривать перенос ключевых операций в Сингапур. Ситуацию осложняют соображения безопасности данных и защиты интеллектуальной собственности. Нейтральный статус Сингапура в технологическом противостоянии США и Китая дает компаниям больше уверенности. Пример — решение хедж-фонда Citadel перевести ключевых сотрудников из Гонконга в Сингапур или Майами. Таким образом, конкуренция выходит за рамки налогов. Гонконг обладает сильными связями с материковым Китаем и развитыми рынками, а Сингапур позиционирует себя как технологический хаб. Для инвестиционных компаний выбор между более низкими налогами и лучшими технологиями будет определять, какой центр привлечет следующую волну талантов.

cryptonews.ru45 мин. назад

Сингапур делает ставку на преимущества искусственного интеллекта, в то время как Гонконг привлекает управляющих инвестициями снижением налогов

cryptonews.ru45 мин. назад

Биткоин-ETF потеряли почти $390 млн за неделю, пока SOL-ETF привлекали новый капитал

С 10 по 14 августа 2026 года спотовые биткоин-ETF в США столкнулись с совокупным оттоком капитала в размере $389,71 млн, согласно данным SoSoValue. Отток наблюдался в четыре из пяти торговых сессий недели, наибольший — из фондов FBTC (Fidelity) и GBTC (Grayscale). Лишь два биткоин-ETF, BTC (Grayscale) и MSBT (Morgan Stanley), зафиксировали приток средств. Сектор Ethereum-ETF также завершил неделю с чистым оттоком в $2,26 млн, где основные потери пришлись на фонды BlackRock и Fidelity. В отличие от них, ETF на базе альткоинов показали положительную динамику. Лидером стал SOL-ETF с притоком $10,26 млн, за которым следуют фонды на базе HYPE, XRP, LINK и HBAR. DOGE-ETF, напротив, зафиксировал небольшой отток. Активность на рынке Гонконга оставалась низкой. Ранее на прошлой неделе в различные криптофонды было привлечено более $1 млрд.

cryptonews.ru46 мин. назад

Биткоин-ETF потеряли почти $390 млн за неделю, пока SOL-ETF привлекали новый капитал

cryptonews.ru46 мин. назад

Внедрение криптовалют в ЕС приостановилось: ЕЦБ выявил, что доля их использования в Интернете составляет всего 0,2%

Последний опрос Европейского центрального банка (ЕЦБ) показал крайне низкий уровень внедрения криптовалют в еврозоне. Исследование, охватившее 8205 компаний, выявило, что наличные деньги остаются самым популярным способом оплаты (92% предприятий), опережая банковские карты (88%). Доля мобильных платежей значительно выросла. При этом криптовалюты практически не используются: лишь 0,2% компаний принимают их для онлайн-покупок, а среди предприятий с физическими точками продаж этот показатель составляет 1%. Это свидетельствует о медленном внедрении цифровых активов бизнесом, несмотря на признание их потенциальных преимуществ, таких как снижение издержек. ЕЦБ подчеркивает важность сохранения доступности наличных денег на фоне растущей автоматизации платежей. Хотя введение регулирования MiCA создало для платежных операторов чёткие рамки и возможности для разработки решений, этого пока недостаточно для ускорения адаптации криптовалют в Европе.

cryptonews.ru47 мин. назад

Внедрение криптовалют в ЕС приостановилось: ЕЦБ выявил, что доля их использования в Интернете составляет всего 0,2%

cryptonews.ru47 мин. назад

СМИ: Anthropic рассчитывает на доход до $200 млрд в 2028 году перед IPO

Компания Anthropic прогнозирует, что ее доход достигнет $190-200 млрд к 2028 году. Инвесторы оценивают компанию перед потенциальным IPO, используя этот будущий показатель и мультипликатор стоимости к доходу (EV/Revenue), что нетипично для размещений. Такой подход связан с масштабным ростом бизнеса: годовой темп дохода вырос с $9 млрд в конце 2025 года до более $47 млрд к маю 2026-го. Компания также ожидает первую квартальную операционную прибыль. Для оценки Anthropic инвесторы сравнивают ее с такими компаниями, как Palantir, Cloudflare и SpaceX, которые также оцениваются с прицелом на будущие финансовые показатели. Основной вызов для Anthropic — превратить огромные инвестиции в ИИ-инфраструктуру (вычислительные мощности, модели, персонал) в устойчивый рост доходов и прибыльности. Некоторые эксперты задаются вопросом о реальной экономической отдаче от ИИ и долгосрочной стабильности столь высокой оценки, которая, по предварительным данным, может превысить $1 трлн.

cryptonews.ru48 мин. назад

СМИ: Anthropic рассчитывает на доход до $200 млрд в 2028 году перед IPO

cryptonews.ru48 мин. назад

Торговля

Спот
活动图片