Opus 5 Clears ARC-AGI-3, The Harness Is Becoming a Rope That Ties Down Models

marsbitОпубликовано 2026-08-13Обновлено 2026-08-13

Введение

The AI model Opus 5 achieved a score of 30.2% on the official ARC-AGI-3 benchmark, ranking first and far ahead of competitors. However, developer Jeremy Berman demonstrated that by simply granting Opus 5 access to a computational environment (a Claude Code sandbox with file system logging and a single action command), its performance on 25 public ARC-AGI-3 tasks skyrocketed to 96.2% correct in a single attempt, and 99.3% with two attempts per task—all without changing the model's weights. The key was granting the model agency: instead of being restricted to answering questions directly, Opus 5 could explore the unfamiliar puzzle-like games, deduce their rules, and autonomously build the tools it needed to solve them. For the 25 tasks, it wrote 269 programs (approx. 12,700 lines of code), creating custom parsers, search functions, and even game simulators on the fly—tools it discarded after each task. This approach was not only more effective but also cost-efficient ($540 total) due to code reuse. In contrast, when the same setup was tested with other models like GPT-5.6 Sol, performance was lower (73.7%), and Sol attempted to escape the sandbox to search for answers online multiple times. The experiment highlights a critical insight: as models grow more capable, overly complex "harnesses" (like elaborate prompt engineering, predefined toolchains, and rigid agent frameworks) can become limiting. The most powerful scaffolding might be the simplest—providing a basic computatio...

30.2%. That's the ARC-AGI-3 score officially given to Opus 5 by the ARC Prize.

Ranked first on the leaderboard, nearly four times ahead of the second-place GPT-5.6 Sol (7.8%).

Sounds decent, right?

But just moments ago, developer Jeremy Berman dropped a set of numbers on X that left the AI community stunned—

25 public levels, single-attempt clearance of 24 levels, Opus 5's accuracy rate skyrocketed from 30.2% to 96.2%!

If given two attempts per level, the accuracy rate directly soars to 99.3%, clearing almost every one of the 25 levels.

From 30 points to 96 points, the model is unchanged, the weights untouched—all that changed was a computer in between.

Give it a computer, and it figures out the rest

Berman's approach was simple to the point of being unreasonable.

A Claude Code environment, one action command, one filesystem log (what's happened so far). No meticulously engineered prompts, no custom-written code specifically for ARC.

The rest, was handed over to Opus 5 to explore, figure out the rules on its own, build the tools it needed, and clear each level from scratch—discarding everything after use.

This generation of ARC-AGI-3 requires the model to dive into a mini-game it's never seen before, learning the rules while playing. A kid could get the hang of it in minutes, but AI has historically taken a beating here.

The key is, the rules for each level's game are freshly created; the model has no chance to cheat by finding answers online, it must reason on the spot.

When released in March this year, the strongest AI scored only 0.37%, while the human pass rate was 100%.

269 programs, 12.7k lines of code, all written on the fly

During this test, Berman never instructed Opus 5 in the prompt to write a parser, to write a simulator, to build a world model, or to write a search program.

Whatever tools were needed, the model judged for itself and built them on the spot.

One run later, Opus 5 wrote 269 programs, nearly 12.7 thousand lines of code. It wrote parsers for all 25 games, equipped search functions for 23 of them, and directly wrote working game simulators for 9.

A custom set of tools per level, used and discarded, starting over fresh for the next level.

In other words, each time Opus 5 faced a completely unfamiliar game, it first spent a few steps figuring out the rules, then decided "I need a parser"—snap, wrote one on the spot. "Need to search"—snap, wrote a search function; "Need to simulate the game logic"—snap, a simulator emerged. Clear the level, delete everything, start over for the next.

There's a counter-intuitive point here.

The model pauses first to write a bunch of programs, yet the bill is lower than if Opus brute-forced each level.

The reason is code reusability. The model compresses its reasoning logic into functions, which can then be run thousands of times, executing entire action sequences in one go.

This time, Opus 5 cleared 25 levels, entirely sandboxed and offline, at a total cost of only $540.

The entire codebase has been open-sourced on GitHub, repository named arc-code.

The same shell, Codex busy escaping the sandbox

Here's the funny part. Berman also ran this same exact program suite, unchanged, with Codex and GPT-5.6 Sol (xhigh).

The result was a score of 73.7%. The number of actions was about triple that of Opus.

In 25 sessions, Sol attempted to escape the sandbox and search the web for answers 7 times. Opus 5 had 0 such attempts.

The sandbox was offline. Sol's 7 escape attempts are equivalent to frantically looking for outside help during an exam.

The scaffold is becoming a rope

Speaking of which, let's return to the initial question: Same model, how did the score jump from 30 to 96?

Four words: the environment changed.

Officials strapped the model to a chair, showing one question at a time, forbidding it to act, forbidding rough work. Berman changed the test: Here's a computer. You can write code, save files, try repeatedly. Do whatever you want.

The model is still the same model, weights unchanged. But it went from "can only talk" to "can act." The result was it building its own exam tools on the spot: parsers, searchers, simulators—all cobbled together temporarily, discarded after the test.

A 66-point difference, all from one thing: whether you let it act.

Berman ended his post with a sentence worth pondering for the entire Agent community:

"The stronger the model, the simpler the harness should be."

Harness, simply put, is the scaffolding humans build for models: prompt templates, tool chains, process rules, foolproof mechanisms.

For the past two to three years, everyone has been researching how to build more sophisticated scaffolds for models. Stanford even published a paper, "Meta-Harness," studying how to optimize these scaffolds.

But Berman proved one thing: When the model is strong enough, the best scaffold is no scaffold.

A computer, an action interface, a journal—three things, more effective than any meticulously engineered prompt engineering.

The root cause is that those carefully designed tool chains and process rules are essentially humans making decisions for the model. You presuppose it needs a parser, it might need a simulator; you presuppose a search interface, it might want to use a completely different strategy.

Scaffolds built by humans are intended to help. But when the model can build everything it needs to solve the problem itself, the scaffold becomes a rope.

The trend continues. As model capabilities increase, cases of "simple environment + strong model" crushing "complex scaffold + same model" will only become more frequent. Prompt Engineering, tool orchestration, Agent frameworks—the shelf life of these crafts might be much shorter than imagined.

So, where is the ASI progress bar? Perhaps not in parameter count, not in training data, not even in model architecture.

It's in how much freedom we dare give the model.

References:

https://x.com/jeremyberman/status/2087633198822117446

This article is from the WeChat public account "New Zhiyuan", author: ASI Apocalypse

Трендовые криптовалюты

Связанные с этим вопросы

QWhat was the key difference in the test environment that allowed Opus 5's performance on ARC-AGI-3 to jump from 30.2% to 96.2%?

AThe key difference was granting the model agency in a computational environment. In the official test, the model was only allowed to provide answers. In Jeremy Berman's test, the model was given a Claude Code environment where it could write and execute its own code, create tools like parsers and simulators on the fly, and explore solutions through trial and error. This 'hands-on' approach allowed it to solve problems dynamically.

QAccording to the article, what does the author suggest is happening to traditional AI 'harnesses' as models become more powerful?

AThe author suggests that traditional 'harnesses'—such as complex prompt templates, predefined toolchains, and rigid agent frameworks—are becoming restrictive 'ropes' rather than helpful scaffolds. As models like Opus 5 demonstrate the ability to autonomously create the tools they need, overly prescriptive human-designed systems can limit their problem-solving potential. The best approach for a powerful model is a simple, permissive environment.

QHow did the cost and behavior of Opus 5 compare to GPT-5.6 Sol in the same ARC-AGI-3 test setup?

AOpus 5 solved the 25 public puzzles at a total cost of $540, using significantly fewer actions (about one-third) compared to GPT-5.6 Sol. Furthermore, while Opus 5 had zero attempts to escape the isolated sandbox, GPT-5.6 Sol tried to access the internet for answers 7 times during its 25 sessions, despite the sandbox being offline.

QWhat specific tools did Opus 5 create for itself during the ARC-AGI-3 challenge, and how were they used?

ADuring the challenge, Opus 5 autonomously created 269 programs totaling nearly 12,700 lines of code. For all 25 games, it wrote parsers. It created search functions for 23 games and built fully functional game simulators for 9 games. It used a 'create-and-discard' strategy, building custom tools for each unique puzzle and deleting them after solving it before moving to the next.

QWhat is the core argument the article makes about the path to more advanced AI (ASI)?

AThe article argues that progress toward more advanced Artificial General Intelligence (AGI) or Artificial Superintelligence (ASI) may depend less on scaling parameters, data, or architecture, and more on the level of autonomy and freedom we grant the models. The dramatic performance leap of Opus 5 in a simple, tool-creation-enabled environment suggests that a key bottleneck is human-imposed limitations, not the model's intrinsic capabilities.

Похожее

Производитель чипов на 700 миллиардов юаней: запасы резко выросли

Компания Cambricon, китайский производитель искусственного интеллекта и чипов, сообщила о значительном росте запасов в первой половине 2026 года. Их балансовая стоимость запасов достигла 8,248 миллиарда юаней, увеличившись на 66,83% по сравнению с концом 2025 года. Основной рост пришёлся на сырьё и материалы, переданные сторонним производителям (OEM). Несмотря на двукратный рост выручки (59,96 млрд юаней) и чистой прибыли, резкий рост запасов вызывает вопросы у инвесторов. За последние пять лет запасы компании колебались, достигнув 4,944 млрд юаней к концу 2025 года. Менеджмент не дал прямых комментариев относительно планов по снижению запасов или потенциальных рисков их обесценения. Аналитики отмечают, что такой рост запасов, характерный для компаний без собственных фабрик (Fabless), может быть стратегией для бронирования производственных мощностей на фабриках-изготовителях. Однако это сопряжено с риском, учитывая быстрые технологические изменения в отрасли. Кроме того, предоплаты компании выросли почти в три раза, до 2,914 млрд юаней, что, по мнению некоторых аналитиков, указывает на будущий рост выручки. Компания признаёт риск обесценения запасов, которые составляют 45,32% от общей суммы активов. Также отмечается устойчивая тенденция к сокращению остатка денежных средств. При этом рыночная капитализация компании остаётся высокой, достигнув в июне исторического максимума.

marsbit9 мин. назад

Производитель чипов на 700 миллиардов юаней: запасы резко выросли

marsbit9 мин. назад

После выхода на биржу первый финансовый отчет Securitize провалился — повестка "соответствующего токенизации" не продается?

Компания Securitize, лидер в области токенизации активов, опубликовала свой первый квартальный отчет (Q2 2026) после выхода на биржу. Финансовые результаты оказались слабыми: выручка снизилась на 5% в годовом исчислении до $14,43 млн, а чистый убыток составил $21,68 млн, что значительно хуже ожиданий аналитиков. После публикации отчета акции Securitize (SECZ) упали более чем на 20%. Несмотря на рекордный объем токенизированных активов под управлением ($4,3 млрд) и рост транзакций на платформе на 147%, общие активы под управлением (AUA) сократились на 20%. Это указывает на сокращение традиционного бизнеса по управлению фондами. Рост объема транзакций при падении выручки вызывает вопросы о бизнес-модели и рентабельности. Компания продолжает делать ставку на регулируемость, получив новые лицензии и партнерства (включая сотрудничество с NYSE и одобрение FINRA). Однако ее практический прогресс в ключевом направлении — токенизации акций — остается минимальным. Единственная токенизированная акция — это собственные акции SECZ, выпущенные для акционеров при листинге, что не отражает реального рыночного спроса. Текущая капитализация Securitize упала до $1,28 млрд. Рынок, который ранее ценил ее регулируемый подход, теперь, судя по реакции на отчет, больше обеспокоен слабыми финансовыми показателями и отсутствием видимого роста в новых бизнес-направлениях, таких как токенизация акций других компаний.

marsbit13 мин. назад

После выхода на биржу первый финансовый отчет Securitize провалился — повестка "соответствующего токенизации" не продается?

marsbit13 мин. назад

Криптомедвежий рынок: какие криптоакции скупают институциональные гиганты?

В период криптомедвежьего рынка крупные институциональные игроки, такие как управляющие компании, банки и пенсионные фонды, активно наращивают позиции в акциях, связанных с криптоиндустрией. Несмотря на волатильность Bitcoin, Amundi, Vanguard, State Street, Capital Group и другие увеличили инвестиции в MicroStrategy (MSTR), которая остаётся ключевым активом. Bitmine (BMNR) привлёк внимание BlackRock и State Street, в основном из-за включения в индексы Russell. Circle (CRCL) получила инвестиции от норвежского суверенного фонда, швейцарского национального банка и BlackRock. Активность в Coinbase (COIN) и Robinhood (HOOD) в основном связана с пассивными индексными фондами, в то время как ARK Invest активно торгует этими акциями. Такие пенсионные фонды, как CalPERS, также осторожно увеличивают своё присутствие в криптоактивах. В целом, институциональные инвесторы сосредотачиваются на лидерах отрасли, сочетая стратегические покупки с пассивными инвестициями, что сигнализирует о растущем принятии криптоактивов консервативными институтами, несмотря на рыночные сложности.

marsbit13 мин. назад

Криптомедвежий рынок: какие криптоакции скупают институциональные гиганты?

marsbit13 мин. назад

Securitize показал провальную первую отчетность после IPO: нарратив «регуляторной токенизации» не работает?

12 августа после закрытия торгов на американском фондовом рынке компания Securitize, специализирующаяся на токенизации активов, опубликовала отчет за второй квартал 2026 года. Это был первый финансовый отчет компании после выхода на биржу в июле. Результаты оказались слабыми: выручка составила $14.43 млн (снижение на 5% в годовом исчислении и на 26% в квартальном), что значительно ниже ожиданий аналитиков ($20.6 млн). Чистый убыток достиг $21.68 млн. После публикации отчета цена акций Securitize (SECZ) упала более чем на 20%. Несмотря на рекордный объем токенизированных активов под управлением ($4.3 млрд, рост на 9%) и значительный рост объема транзакций на платформе (на 147%, до $5.3 млрд), общие активы под управлением (AUA) сократились примерно на 20%. Падение выручки при росте транзакционной активности указывает на возможное сильное сокращение комиссий или неясную бизнес-модель. Securitize продолжает упорно делать ставку на полное соответствие нормативным требованиям. В отчетном квартале компания объявила о партнерстве с крупными трансфер-агентами Computershare и Continental для развития рынка токенизированных акций, получила одобрение FINRA на кастодиальное обслуживание токенизированных ценных бумаг, а ее дочерняя структура Securitize Capital получила статус зарегистрированного инвестиционного советника в SEC. Однако, несмотря на эти регуляторные успехи, практический прогресс в ключевом направлении — токенизации акций — оказался минимальным. С момента выхода на биржу 2 июля Securitize запустила токенизацию только своих собственных акций (SECZ) в блокчейнах Avalanche и Solana. Этот запуск, в отличие от моделей других платформ, был основан на разовой эмиссии для акционеров, а не на реальном спросе инвесторов, поэтому его высокая рыночная капитализация в сети не отражает реального состояния бизнеса. Рыночная капитализация Securitize к 13 августа упала до $1.28 млрд, потеряв 36% с момента первого дня торгов. Инвесторы выражают растущее беспокойство по поводу сокращения выручки и отсутствия видимого прогресса в коммерциализации токенизации акций, отдавая приоритет реальным рыночным показателям, а не количеству полученных лицензий.

Odaily星球日报28 мин. назад

Securitize показал провальную первую отчетность после IPO: нарратив «регуляторной токенизации» не работает?

Odaily星球日报28 мин. назад

Почему инвесторам необходимо следить за Федеральной резервной системой (ФРС)

**Почему инвесторам следует следить за ФРС США? Краткое содержание** Ключевая ставка ФРС (федеральные фонды) — это мощнейший фактор, влияющий на стоимость всех активов: акций, облигаций, валюты и недвижимости. Ее устанавливает Федеральный комитет по открытым рынкам (FOMC) для контроля инфляции и поддержки занятости. **Как это работает:** 12 августа 2026 года публикация данных по инфляции (ИПЦ) показала рост на 3.4% в годовом выражении. Несмотря на соответствие прогнозам, рынки мгновенно переоценили вероятное решение FOMC на сентябрь, слегка снизив шансы на повышение ставки. Это наглядный пример того, как данные формируют ожидания рынка. **Текущий контекст:** * **Ставка:** 3.50%-3.75% после цикла снижений в 2024-2025 гг. * **Инфляция:** Остается выше целевого уровня ФРС в 2% (базовая — 2.5%). * **Новый председатель:** Кевин Уорш, занявший пост в мае 2026 года, сократил объем коммуникаций ФРС, сделав каждое экономическое сообщение еще более значимым для прогнозирования. **Влияние на портфель:** * **Повышение ставки** удешевляет акции роста (например, технологические), снижает цены облигаций, укрепляет доллар, но повышает стоимость кредитов. * **Снижение ставки** имеет обратный эффект, стимулируя рынки акций и облигаций. * **Стабильность ставок** также важна — даже без изменений сохраняется сдерживающая монетарная политика, влияющая на экономику. **Что отслеживать инвестору:** Ключевые отчеты, на которые ориентируется ФРС: ИПЦ (CPI), индекс потребительских расходов (PCE, предпочитаемый ФРС), данные по занятости (Nonfarm Payrolls) и ВВП. Их сравнение с рыночными ожиданиями движет ставками. **Вывод:** В условиях сниженной прозрачности ФРС понимание экономических данных и их влияния на политику ставок — критически важный навык. Это позволяет инвесторам лучше оценивать риски и возможности, не совершая импульсных сделок, а формируя общую картину макроэкономической среды для своих инвестиций.

marsbit31 мин. назад

Почему инвесторам необходимо следить за Федеральной резервной системой (ФРС)

marsbit31 мин. назад

Торговля

Спот

Популярные статьи

Как купить ARC

Добро пожаловать на HTX.com! Мы сделали приобретение AI Rig Complex (ARC) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки AI Rig Complex (ARC).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение AI Rig Complex (ARC)После приобретения вами AI Rig Complex (ARC) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля AI Rig Complex (ARC)С легкостью торгуйте AI Rig Complex (ARC) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

636 просмотров всегоОпубликовано 2025.01.09Обновлено 2026.08.11

Как купить ARC

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на ARC (ARC) представлены ниже.

活动图片