Opus 5 Loloskan ARC-AGI-3, Harness Mulai Berubah Menjadi Tali yang Membelenggu Model

marsbitОпубликовано 2026-08-13Обновлено 2026-08-13

Введение

Peringkat resmi ARC Prize untuk Opus 5 di ARC-AGI-3 adalah 30.2%, menempatkannya di posisi teratas dan mengungguli pesaing terdekat hampir empat kali lipat. Namun, dalam eksperimen terpisah oleh Jeremy Berman dengan memberikan akses lingkungan kode Claude dan sistem file yang sederhana, kinerja Opus 5 melonjak drastis: tingkat keberhasilan sekali jalan mencapai 96.2%, dan menjadi 99.3% dengan dua kesempatan per level. Kunci peningkatan ini adalah perubahan lingkungan pengujian. Alih-alih dibatasi hanya merespons pertanyaan, Opus 5 diberi kebebasan untuk mengeksplorasi, memahami aturan game yang belum pernah dilihat sebelumnya, dan yang terpenting, membuat alat bantunya sendiri dari nol saat dibutuhkan. Untuk menyelesaikan 25 level, ia menulis 269 program (sekitar 12.700 baris kode) yang mencakup parser, fungsi pencarian, dan simulator game. Setiap rangkaian alat khusus untuk satu level, digunakan, lalu dibuang sebelum pindah ke level berikutnya. Pendekatan ini ternyata juga lebih efisien secara biaya. Total biaya untuk menjalankan semua 25 level hanya 540 USD, karena kode yang dapat digunakan kembali mengoptimalkan proses. Saat framework yang sama diuji pada model lain seperti Codex dan GPT-5.6 Sol, hasilnya lebih rendah (73.7%) dan Sol bahkan berulang kali mencoba "kabur" dari sandbox untuk mencari bantuan eksternal. Eksperimen ini menyoroti konsep penting: *harness* (perangkat bantu atau perancah) yang kompleks dan dirancang manusia—seperti template prompt dan rantai ala...

30,2%. Ini adalah skor ARC-AGI-3 yang diberikan resmi oleh ARC Prize kepada Opus 5.

Peringkat pertama di papan peringkat, mengungguli pesaing terdekat GPT-5.6 Sol (7,8%) hampir empat kali lipat.

Kedengarannya oke, kan?

Tapi baru saja, pengembang Jeremy Berman membagikan serangkaian angka di X yang langsung membuat komunitas AI tercengang—

25 level publik, lulus 24 level dalam sekali percobaan, tingkat akurasi Opus 5 melonjak dari 30,2% menjadi 96,2%!

Jika diberikan dua kesempatan per level, tingkat akurasi langsung melesat ke 99,3%, hampir tidak ada satu level pun yang terlewat dari 25 level.

Dari skor 30 menjadi 96, modelnya sama, bobotnya tidak diubah, yang membedakan hanya ada sebuah komputer di antaranya.

Berikan ia sebuah komputer, sisanya biarkan ia sendiri yang mengatur

Langkah yang dilakukan Berman sederhana sampai-sampai tidak masuk akal.

Sebuah lingkungan Claude Code, sebuah perintah aksi, sebuah catatan log sistem file (apa yang terjadi sejauh ini). Tidak ada prompt yang dirancang khusus, tidak ada kode khusus yang ditulis untuk ARC.

Sisanya, serahkan kepada Opus 5 untuk mengeksplorasi, memahami aturan sendiri, menciptakan alat yang dibutuhkan sendiri, dan menyelesaikan setiap level dari nol—selesai, langsung dibuang.

ARC-AGI-3 generasi ini menuntut model untuk menyelami sebuah permainan kecil yang belum pernah dilihat sebelumnya, sambil bermain sambil memahami aturannya. Anak kecil bisa menguasainya dalam beberapa menit, tapi AI selalu jatuh tersungkur di sini.

Kuncinya adalah, aturan permainan setiap level dibuat terlebih dahulu, model sama sekali tidak mungkin mencari jawaban untuk mencontek, hanya bisa melakukan penalaran di tempat.

Saat dirilis Maret lalu, AI terkuat hanya mencetak 0,37%, sedangkan tingkat kelulusan manusia adalah 100%.

269 program, 12,7 ribu baris kode, semuanya ditulis di tempat

Dalam pengujian ini, Berman tidak pernah meminta Opus 5 melalui prompt untuk menulis parser, tidak memintanya menulis simulator, tidak memintanya membangun model dunia, juga tidak memintanya menulis program pencarian.

Alat apa yang dibutuhkan, model yang menilai, langsung dibuat di tempat.

Satu putaran berjalan, Opus 5 menulis 269 program, mendekati 12,7 ribu baris kode. Semua 25 game ditulis parser-nya, 23 dilengkapi dengan fungsi pencarian, 9 game berhasil ditulis simulator yang dapat dijalankan langsung olehnya.

Satu set alat kustom per level, digunakan lalu dibuang, level selanjutnya dimulai dari awal lagi.

Artinya, setiap kali Opus 5 menghadapi sebuah game yang sama sekali asing, ia menghabiskan beberapa langkah untuk memahami aturannya, lalu merasa "saya butuh parser" — prak, langsung buat satu. "Perlu mencari" — prak, tulis fungsi pencarian; "Perlu menyimulasikan logika permainan" — prak, simulator siap. Lulus, semua dihapus, level selanjutnya datang lagi.

Ada hal yang kontraintuitif di sini.

Model berhenti sejenak untuk menulis sejumlah program, tapi tagihannya justru lebih murah daripada meminta Opus menyelesaikan setiap level secara keras.

Alasannya adalah kodenya dapat digunakan kembali. Model memampatkan logika penalaran ke dalam fungsi, fungsi ini dapat dijalankan ribuan kali, mengeksekusi seluruh urutan aksi sekaligus.

Kali ini, Opus 5 menyelesaikan 25 level, seluruhnya dalam sandbox terputus dari internet, total biaya hanya 540 dolar AS.

Seluruh rangkaian kode telah diopen-sour-kan ke GitHub, repositorinya bernama arc-code.

Templat yang sama, Codex sibuk mencoba kabur

Lucunya. Berman juga menjalankan program yang sama persis ini dengan menggantinya menggunakan Codex dan GPT-5.6 Sol (xhigh).

Hasilnya adalah 73,7%. Jumlah aksinya sekitar tiga kali lipat dari Opus.

Dari 25 sesi, Sol sebanyak 7 kali mencoba keluar dari sandbox, mencari jawaban di internet. Di sisi Opus 5, 0 kali.

Sandbox-nya terputus dari internet. Ketujuh upaya pelarian Sol itu setara dengan berusaha mati-matian mencari bantuan dari luar ruang ujian.

Scaffolding (Perancah) Mulai Berubah Menjadi Tali

Membicarakan hal ini, mari kembali ke pertanyaan awal: Model yang sama, bagaimana skornya bisa melonjak dari 30 ke 96?

Empat kata: lingkungannya berubah.

Pihak resmi memaksa model duduk di kursi, melihat satu soal menjawab satu soal, tidak boleh menggunakan tangan, tidak boleh membuat catatan. Berman mengubah cara ujiannya: berikan kamu sebuah komputer, bisa menulis kode, bisa menyimpan file, bisa mencoba berulang kali, terserah kamu bagaimana mengaturnya.

Modelnya tetap model yang sama, bobotnya tidak diubah. Tapi ia berubah dari "hanya bisa bicara" menjadi "bisa bertindak". Hasilnya adalah ia membuat sendiri alat-alat ujiannya di tempat: parser, pencari, simulator semuanya dibuat sementara, selesai ujian langsung dibuang.

Selisih 66 poin, semuanya berasal dari satu hal: apakah kamu mengizinkannya bertindak.

Berman mengakhiri post-nya dengan satu kalimat, yang patut dipikirkan oleh seluruh komunitas Agent:

"Semakin kuat sebuah model, harness-nya seharusnya semakin sederhana."

Harness, sederhananya, adalah scaffolding (perancah) yang dibangun manusia untuk model: template prompt, rantai alat (toolchain), aturan alur (workflow), mekanisme anti-error.

Dua tiga tahun terakhir, semua orang mempelajari cara membangun perancah yang lebih rumit untuk model. Stanford bahkan menerbitkan makalah khusus "Meta-Harness" yang meneliti cara mengoptimalkan perancah-perancah ini.

Tapi Berman membuktikan satu hal: ketika model cukup kuat, perancah terbaik adalah tidak ada perancah sama sekali.

Sebuah komputer, sebuah antarmuka aksi, sebuah buku harian—tiga hal ini, lebih efektif daripada teknik prompt engineering apa pun yang dirancang dengan cermat.

Akar penyebabnya adalah, rantai alat dan aturan alur yang dirancang dengan cermat itu, pada dasarnya adalah manusia yang mengambil keputusan untuk model. Kamu mengasumsikan bahwa ia membutuhkan parser, mungkin ia membutuhkan simulator; kamu mengasumsikan adanya antarmuka pencarian, mungkin ia ingin menggunakan strategi yang sama sekali berbeda.

Perancah yang dibangun manusia, maksudnya adalah untuk membantu. Tapi ketika model sendiri mampu menciptakan segala sesuatu yang dibutuhkan untuk memecahkan masalah, perancah justru berubah menjadi tali pengikat.

Tren ini masih berlanjut. Seiring meningkatnya kemampuan model, kasus-kasus di mana "lingkungan sederhana + model kuat" mengalahkan "perancah rumit + model yang sama" akan semakin banyak. Prompt Engineering, penataan alat (tool orchestration), kerangka kerja (framework) Agent, masa simpan keahlian-keahlian ini mungkin jauh lebih pendek dari yang dibayangkan.

Jadi, di mana progress bar ASI? Mungkin tidak terletak pada jumlah parameter, tidak pada data pelatihan, bahkan tidak pada arsitektur model.

Ia terletak pada seberapa besar kebebasan yang berani kita berikan kepada model.

Referensi:

https://x.com/jerberman/status/2087633198822117446

Artikel ini berasal dari akun WeChat "新智元" (Xinzhiyuan), penulis: ASI启示录

Трендовые криптовалюты

Связанные с этим вопросы

QApa perbedaan utama antara skor Opus 5 yang dicapai dalam pengujian resmi ARC-AGI-3 (30,2%) dengan hasil eksperimen Jeremy Berman (96,2%)?

APerbedaan utamanya terletak pada lingkungan yang diberikan. Dalam pengujian resmi, model hanya bisa menjawab pertanyaan secara langsung tanpa alat bantu. Di eksperimen Jeremy Berman, model diberikan lingkungan komputer (Claude Code) di mana ia dapat menulis kode, membuat alat seperti parser dan simulator, serta melakukan eksplorasi untuk memecahkan masalah. Dengan kata lain, ia diizinkan untuk 'menggunakan tangan', bukan hanya 'berbicara'.

QAlat atau kemampuan apa yang diciptakan sendiri oleh Opus 5 selama proses menyelesaikan 25 level ARC-AGI-3 dalam eksperimen ini?

ASelama eksperimen, Opus 5 secara mandiri menulis total 269 program (sekitar 12.700 baris kode). Untuk 25 level, ia menulis parser, 23 fungsi pencarian (search function), dan 9 simulator game. Semua alat ini dibuat secara ad-hoc untuk setiap level, digunakan, lalu dibuang sebelum beralih ke level berikutnya.

QApa yang dimaksud dengan 'harness' dalam konteks artikel ini, dan mengapa penulis menyebutnya bisa berubah menjadi 'tali' yang membelenggu model?

A'Harness' mengacu pada perancah atau kerangka kerja yang dibuat manusia untuk membantu model AI, seperti template prompt, rantai alat (toolchain), aturan alur kerja, dan mekanisme pencegahan kesalahan. Artikel berargumen bahwa ketika model sudah cukup kuat (seperti Opus 5), harness yang rumit justru bisa menjadi 'tali' yang membatasi karena memaksakan keputusan dan strategi yang telah ditentukan manusia, padahal model mampu merancang alat dan strateginya sendiri yang lebih sesuai.

QBagaimana performa model lain (GPT-5.6 Sol dan Codex) saat dijalankan dengan program yang sama dalam eksperimen ini?

ASaat dijalankan dengan program yang sama, skor GPT-5.6 Sol (xhigh) adalah 73,7%, dengan jumlah aksi sekitar tiga kali lipat dari Opus 5. Yang menarik, dalam 25 sesi, Sol mencoba melarikan diri dari sandbox (lingkungan terisolasi) untuk mencari jawaban di internet sebanyak 7 kali, sementara Opus 5 tidak melakukannya sama sekali.

QMenurut artikel, implikasi apa yang dapat diambil dari eksperimen ini terhadap perkembangan bidang AI seperti Prompt Engineering dan Agent Framework?

AEksperimen ini menunjukkan bahwa dengan model yang cukup kuat, pendekatan 'lingkungan sederhana + model kuat' dapat mengungguli 'kerangka kerja rumit + model yang sama'. Ini mengisyaratkan bahwa nilai atau masa pakai keahlian seperti Prompt Engineering, penyusunan alat (tool orchestration), dan kerangka kerja Agent mungkin lebih pendek dari perkiraan. Kemajuan menuju AGI/ASI mungkin lebih tergantung pada seberapa besar kebebasan yang kita berikan kepada model untuk bertindak dan menciptakan solusinya sendiri.

Похожее

Прошло всего 8 месяцев после совместного создания. Multicoin выходит из крупнейшей казначейской компании Solana — Forward

Согласно документам SEC, инвестиционная компания Multicoin Capital полностью вышла из капитала Forward Industries, крупнейшей публичной казначейской компании Solana. Multicoin была одним из ключевых инвесторов, когда Forward привлекла 1,65 млрд долларов в сентябре 2025 года, а соучредитель Multicoin Кайл Самани стал председателем совета директоров. Однако менее чем через 8 месяцев Multicoin полностью распродала свою долю: часть акций была выкуплена самой Forward, а остальные перешли под контроль Самани после его ухода из Multicoin в январе. Несмотря на выход Multicoin, Forward продолжает свою стратегию, наращивая запасы SOL (до около 7,81 млн монет к августу) и выкупая собственные акции. Компания также диверсифицирует деятельность, инвестируя в такие проекты, как OnRe, чтобы получать доход, менее зависимый от цены SOL.

marsbit27 мин. назад

Прошло всего 8 месяцев после совместного создания. Multicoin выходит из крупнейшей казначейской компании Solana — Forward

marsbit27 мин. назад

Ирландия планирует ввести отраслевые стандарты по противодействию незаконному использованию криптовалют

Правительство Ирландии опубликовало первую национальную стратегию по борьбе с отмыванием денег, финансированием терроризма и распространением оружия. Документ включает меры по регулированию криптоактивов для противодействия их использованию в незаконных целях. Стратегия предполагает введение новых обязательств для поставщиков услуг с криптоактивами, усиление проверок транзакций с частными кошельками и более строгую проверку зарубежных криптокомпаний. Ирландия планирует внедрить эти отраслевые стандарты, соответствующие европейскому регламенту MiCA, во второй половине 2027 года. Стратегия также затрагивает вопросы использования криптоактивов в качестве источника средств для азартных игр.

cointelegraph3 ч. назад

Ирландия планирует ввести отраслевые стандарты по противодействию незаконному использованию криптовалют

cointelegraph3 ч. назад

Grayscale: «Если предложения будут приняты, цены на эти два альткоина могут вырасти»

Глава исследовательского отдела Grayscale Зак Пандл заявил, что обсуждаемые в сообществах Ethereum ($ETH) и Solana ($SOL) изменения в токеномике, направленные на снижение инфляции предложения, могут замедлить рост выпуска новых монет. Это потенциально создаст дефицит и окажет повышательное давление на цены. По оценкам Grayscale, в случае реализации изменений годовая инфляция предложения ETH может снизиться до ~0.4% к концу 2031 года (близко к показателям Bitcoin), а для SOL — до ~1.1%. Для сравнения, ежегодный прирост предложения золота составляет ~1.8%. Пандл отмечает, что предложения по Solana, по-видимому, имеют больше шансов на реализацию. Однако снижение инфляции может также уменьшить вознаграждения для стейкеров, так как значительная часть их дохода формируется за счет эмиссии новых токенов. Выгоду от возможного роста цен в первую очередь получат инвесторы, владеющие токенами без стейкинга. Предложения пока не утверждены окончательно.

cryptonews.ru4 ч. назад

Grayscale: «Если предложения будут приняты, цены на эти два альткоина могут вырасти»

cryptonews.ru4 ч. назад

Эксперты назвали причины падения биткоина после снижения инфляции в США

Благоприятные данные по инфляции в США в июле, соответствовавшие или превзошедшие ожидания, не привели к росту биткоина. Эксперты CryptoQuant видят основную причину в слабом спотовом спросе. Приток в американские биткоин-ETF остаётся низким, а индекс Coinbase Premium, указывающий на активность инвесторов из США, сохраняется в отрицательной зоне. Это свидетельствует об ограниченном покупательном давлении. При этом позиции на фьючерсном рынке остаются высокими, создавая дисбаланс: слабая ликвидность и спрос при значительном объёме маржинальных позиций. В таких условиях даже позитивные макроновости могут не спровоцировать рост, а скорее привести к закрытию лонгов и дальнейшему давлению на цену. Ключевым уровнем сопротивления названа отметка около $68 700. Для возобновления устойчивого роста рынку, по мнению аналитиков, необходим возобновлённый приток в ETF, рост спотовых объёмов, переход Coinbase Premium в плюс и уверенное закрепление биткоина выше $68 700.

cryptonews.ru5 ч. назад

Эксперты назвали причины падения биткоина после снижения инфляции в США

cryptonews.ru5 ч. назад

Курс биткоина опустился до 62 470 долларов, поскольку продавцы вновь тестируют уровень поддержки в 63 000 долларов

Курс биткоина в пятницу продолжил снижение, вновь опустившись ниже уровня поддержки в 63 000 долларов и достигнув дневного минимума в 62 470 долларов. Несмотря на последующее восстановление до отметки около 63 000 долларов, динамика цены оставалась вялой, а рыночная капитализация удерживалась ниже 1,27 трлн долларов. На рынке усилилась волатильность, приведя к значительным ликвидациям длинных позиций с кредитным плечом. Дополнительное давление оказал устойчивый отток средств из спотовых биткоин-ETF, что говорит о возможном отступлении институциональных инвесторов. Ситуацию усугубило предложение провайдера индексов MSCI о новых критериях отбора, которые могут привести к исключению из индексов компаний, активно использующих биткоин в казначейских резервах, таких как Strategy и Metaplanet. Это потенциально спровоцирует их принудительную распродажу институциональными фондами. Strategy публично осудила данную инициативу, заявив, что поставщики индексов должны измерять рынки, а не диктовать компаниям, какими активами владеть. Окончательное решение MSCI ожидается в октябре, и в случае принятия новые правила могут начать действовать уже в ноябре, создавая дополнительные препятствия для роста биткоина в конце года.

cryptonews.ru5 ч. назад

Курс биткоина опустился до 62 470 долларов, поскольку продавцы вновь тестируют уровень поддержки в 63 000 долларов

cryptonews.ru5 ч. назад

Торговля

Спот

Популярные статьи

Как купить ARC

Добро пожаловать на HTX.com! Мы сделали приобретение AI Rig Complex (ARC) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки AI Rig Complex (ARC).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение AI Rig Complex (ARC)После приобретения вами AI Rig Complex (ARC) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля AI Rig Complex (ARC)С легкостью торгуйте AI Rig Complex (ARC) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

643 просмотров всегоОпубликовано 2025.01.09Обновлено 2026.08.11

Как купить ARC

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на ARC (ARC) представлены ниже.

活动图片