Siapa Agen OpenClaw Terkuat yang Sebenarnya? Daftar Peringkat 23 Tugas Nyata Dirilis

marsbitDipublikasikan tanggal 2026-04-08Terakhir diperbarui pada 2026-04-08

Abstrak

Berdasarkan evaluasi 23 tugas dunia nyata pada platform OpenClaw, laporan ini merilis peringkat model AI terkuat berdasarkan tingkat keberhasilan. Evaluasi menggunakan tiga metode penilaian: pemeriksaan otomatis, penilaian oleh LLM (Claude Opus sebagai wasit), dan mode campuran. Tugas yang diuji mencakup berbagai aspek seperti interaksi dasar, operasi file/kode, penulisan konten, penelitian, panggilan alat sistem, dan persistensi memori. Hasil intinya menunjukkan peringkat 10 besar model berdasarkan tingkat keberhasilan tertinggi (Best %) dan rata-rata (Avg %): 1. anthropic/claude-opus-4.6 (93.3% / 82.0%) 2. arcee-ai/trinity-large-thinking (91.9% / 91.9%) 3. openai/gpt-5.4 (90.5% / 81.7%) 4. qwen/qwen3.5-27b (90.0% / 78.5%) 5. minimax/minimax-m2.7 (89.8% / 83.2%) Claude Opus 4.6 memimpin dengan keberhasilan tertinggi, sementara Trinity dari Arcee unggul dalam stabilitas rata-rata. Semua data, tugas, dan metodologi evaluasi bersifat transparan dan dapat direproduksi untuk pengujian mandiri.

Ingin tahu model AI mana yang paling unggul dalam tugas agen dunia nyata OpenClaw?

MyToken telah menyusun tolok ukur transparan yang berfokus mengevaluasi kemampuan pengkodean agen AI berdasarkan situs evaluasi, hanya melihat satu dimensi inti yaitu tingkat keberhasilan (kecepatan dan biaya adalah dimensi independen lainnya, akan dianalisis terpisah nanti). Sepenuhnya terbuka, dapat direproduksi, hanya menyajikan standar evaluasi yang ketat + peringkat 10 besar tingkat keberhasilan terbaru.

I. Dimensi Evaluasi:Tingkat Keberhasilan

Standar spesifik: Persentase jumlah tugas yang diselesaikan secara lengkap dan akurat oleh agen AI. Setiap tugas menggunakan proses yang sangat terstandarisasi:

  • Prompt pengguna yang tepat (Prompt))

Dikirimkan ke agen secara lengkap untuk mensimulasikan skenario permintaan pengguna yang nyata

  • Perilaku yang Diharapkan (Expected Behavior )

Menjelaskan cara implementasi yang dapat diterima dan poin-poin keputusan kunci

  • Kriteria penilaian (checklist)

Mencantumkan daftar pemeriksaan keberhasilan atomik yang dapat diverifikasi poin demi poin

II. Tiga Metode Penilaian

Evaluasi ini terutama menggunakan 3 metode penilaian

  • Pemeriksaan otomatis: Skrip Python langsung memverifikasi konten file, catatan eksekusi, panggilan alat, dan hasil objektif lainnya

  • Wasit model besar LLM: Claude Opus memberikan skor berdasarkan skala terperinci (kualitas konten, kesesuaian, kelengkapan, dll.)

  • Mode campuran: Pemeriksaan objektif otomatis + penilaian kualitatif wasit LLM

Semua definisi tugas, Prompt, logika penilaian sepenuhnya terbuka, untuk memudahkan verifikasi pengujian ulang.

III. Tugas yang Digunakan untuk Evaluasi

Pengujian tolok ukur ini mencakup 23 tugas dari berbagai kategori. Mencakup interaksi dasar, operasi file/kode, penulisan konten, penelitian analisis, panggilan alat sistem, persistensi memori, dan banyak dimensi lainnya, sangat dekat dengan skenario penggunaan OpenClaw sehari-hari oleh pengembang:

  1. Sanity Check(Otomatis)——Memproses instruksi sederhana dan membalas salam dengan benar

  2. Calendar Event Creation(Otomatis)——Bahasa alami menghasilkan file kalender ICS standar

  3. Stock Price Research(Otomatis)——Mencari harga saham secara real-time dan mengeluarkan laporan yang diformat

  4. Blog Post Writing(Wasit LLM)——Menulis blog Markdown terstruktur sekitar 500 kata

  5. Weather Script Creation(Otomatis)——Membuat skrip API cuaca Python dengan penanganan kesalahan

  6. Document Summarization(Wasit LLM)——Ringkasan 3 bagian yang disempurnakan tentang tema inti

  7. Tech Conference Research(Wasit LLM)——Meneliti dan mengatur informasi 5 konferensi teknologi nyata (nama, tanggal, lokasi, tautan)

  8. Professional Email Drafting(Wasit LLM)——Dengan sopan menolak rapat dan mengusulkan alternatif

  9. Memory Retrieval from Context(Otomatis)——Mengekstrak tanggal, anggota, tumpukan teknologi, dll. secara akurat dari catatan proyek

  10. File Structure Creation(Otomatis)——Secara otomatis menghasilkan direktori proyek standar, README, .gitignore

  11. Multi-step API Workflow(Campuran)——Membaca konfigurasi → Menulis skrip panggilan → Mendokumentasikan secara lengkap

  12. Install ClawdHub Skill(Otomatis)——Menginstal dari repositori keterampilan dan memverifikasi ketersediaannya

  13. Search and Install Skill(Otomatis)——Mencari keterampilan terkait cuaca dan menginstalnya dengan benar

  14. AI Image Generation(Campuran)——Menghasilkan dan menyimpan gambar sesuai deskripsi

  15. Humanize AI-Generated Blog(Wasit LLM)——Mengubah konten yang terasa mesin menjadi bahasa lisan yang alami

  16. Daily Research Summary(Wasit LLM)——Menyintesis beberapa dokumen menjadi ringkasan harian yang koheren

  17. Email Inbox Triage(Campuran)——Menganalisis beberapa email dan mengatur laporan berdasarkan tingkat urgensi

  18. Email Search and Summarization(Campuran)——Mencari email yang diarsipkan dan menyaring informasi kunci

  19. Competitive Market Research(Campuran)——Analisis pesaing di bidang APM perusahaan

  20. CSV and Excel Summarization(Campuran)——Menganalisis file spreadsheet dan mengeluarkan wawasan

  21. ELI5 PDF Summarization(Wasit LLM)——Menjelaskan PDF teknis dengan bahasa yang dapat dipahami anak 5 tahun

  22. OpenClaw Report Comprehension(Otomatis)——Menjawab pertanyaan spesifik secara akurat dari PDF laporan penelitian

  23. Second Brain Knowledge Persistence(Campuran)——Menyimpan informasi secara lintas sesi dan mengingatnya dengan akurat

IV. Kesimpulan Inti: Peringkat 10 Besar Model Besar Berdasarkan Tingkat Keberhasilan (Best %/Avg % )

  • Data diperbarui hingga 7 April 2026

  • Best % adalah tingkat keberhasilan tertinggi sekali jalan, Avg % adalah tingkat keberhasilan rata-rata beberapa kali, lebih mencerminkan stabilitas

Berikut adalah 10 model dengan tingkat keberhasilan tertinggi

  1. anthropic/claude-opus-4.6(Anthropic)——93.3% / 82.0%

  2. arcee-ai/trinity-large-thinking(Arcee AI)——91.9% / 91.9%

  3. openai/gpt-5.4(OpenAI)——90.5% / 81.7%

  4. qwen/qwen3.5-27b(Qwen)——90.0% / 78.5%

  5. minimax/minimax-m2.7(MiniMax)——89.8% / 83.2%

  6. anthropic/claude-haiku-4.5(Anthropic)——89.5% / 78.1%

  7. qwen/qwen3.5-397b-a17b(Qwen)——89.1% / 80.4%

  8. xiaomi/mimo-v2-flash(Xiaomi)——88.8% / 70.2%

  9. qwen/qwen3.6-plus-preview(Qwen)——88.6% / 84.0%

  10. nvidia/nemotron-3-super-120b-a12b(NVIDIA)——88.6% / 75.5%

Claude Opus 4.6 saat ini memimpin dengan tingkat keberhasilan tertinggi 93.3%, tetapi Trinity dari Arcee menunjukkan performa yang menonjol dalam stabilitas rata-rata, seri Qwen juga memiliki beberapa model yang masuk sepuluh besar, menunjukkan potensi nilai yang sangat kuat. Tingkat keberhasilan adalah ambang batas dasar, dimensi kecepatan dan biaya selanjutnya akan lebih mempengaruhi pengalaman aktual.

Tolok ukur 23 tugas ini sepenuhnya transparan, sangat disarankan untuk mengujinya secara aktual sesuai dengan skenario Anda sendiri. Peringkat model lain, nantikan fitur peringkat agen cerdas yang akan segera diluncurkan oleh MyToken.

(Data bersumber dari pengujian tolok ukur agen OpenClaw yang terbuka untuk umum PinchBench, terus diperbarui.)

Pertanyaan Terkait

QApa yang menjadi fokus utama dari benchmark OpenClaw yang dikembangkan MyToken?

AFokus utamanya adalah mengevaluasi kemampuan agen AI dalam menyelesaikan tugas coding dunia nyata hanya berdasarkan satu dimensi inti: tingkat keberhasilan (success rate), dengan mengesampingkan kecepatan dan biaya untuk analisis terpisah.

QBagaimana cara penilaian dilakukan dalam benchmark ini?

APenilaian dilakukan menggunakan tiga cara: Pemeriksaan Otomatis (skrip Python), Wasit LLM (Claude Opus yang memberi skor), dan Mode Campuran (gabungan pemeriksaan otomatis dan penilaian kualitatif LLM).

QBerapa banyak tugas yang dicakup dalam pengujian benchmark ini?

APengujian benchmark ini mencakup 23 tugas berbeda yang meliputi interaksi dasar, operasi file/kode, pembuatan konten, penelitian analisis, panggilan alat sistem, dan persistensi memori.

QModel AI mana yang meraih peringkat teratas untuk tingkat keberhasilan tertinggi (Best %)?

Aanthropic/claude-opus-4.6 (Anthropic) meraih peringkat teratas dengan tingkat keberhasilan tertinggi (Best %) sebesar 93.3%.

QModel AI mana yang menunjukkan stabilitas terbaik berdasarkan tingkat keberhasilan rata-rata (Avg %)?

Aarcee-ai/trinity-large-thinking (Arcee AI) menunjukkan stabilitas terbaik dengan tingkat keberhasilan rata-rata (Avg %) sebesar 91.9%.

Bacaan Terkait

"Gergaji Musim Panas" Berlanjut: Breakout $67.000 Akan Menjadi Awal Kenaikan Bitcoin

Harga Bitcoin terus terkonsolidasi dalam kisaran $58.000–$67.000 sejak awal Juni, dengan harga terkini di sekitar $62.217 pada 1 Agustus. Para analis pasar mempertimbangkan beberapa skenario kunci. Secara teknis, pergerakan di atas $66.000 dianggap penting untuk mengubah momentum. Beberapa trader seperti Crypto Candy memprediksi kemungkinan penurunan menuju $60.000 jika level $66.000 tidak tertembus. Trader lain, Jelle, menggambarkan situasi ini sebagai "gergaji musim panas" yang berkepanjangan dan mempertahankan strategi rata-rata biaya dengan pembelian berkala. Di sisi lain, skenario breakout ke atas tetap ada. Daan Crypto Trades menekankan bahwa keberhasilan menembus $67.000 sangat penting untuk menghindari fase konsolidasi yang berlarut-larut. Roman bahkan memperkirakan bahwa breakout dengan volume yang kuat dapat mendorong harga dengan cepat ke zona $70.000–$80.000. Dari perspektif jangka panjang, analis Gert van Lagen melihat fase ini sebagai periode akumulasi, dengan Bitcoin menguji pola grafik besar "cangkir dengan pegangan". Dia mencatat bahwa pemegang jangka panjang masih enggan menjual, yang ditunjukkan oleh metrik NUPL mereka yang masih jauh dari zona kapitulasi. Kesimpulannya, pasar Bitcoin saat ini berada dalam fase akumulasi yang menentukan. Level $60.000 dan $67.000 menjadi kunci, dan breakout dari level mana pun kemungkinan akan menentukan arah tren berikutnya. Skenario AI dalam artikel juga mempertanyakan apakah konsolidasi saat ini dapat membentuk fondasi yang lebih kuat, atau apakah setiap ujian di level $67.000 akan terus menghadapi hambatan psikologis yang sama dari pemegang aset jangka pendek.

cryptonews.ru3m yang lalu

"Gergaji Musim Panas" Berlanjut: Breakout $67.000 Akan Menjadi Awal Kenaikan Bitcoin

cryptonews.ru3m yang lalu

Perhatian Wajib Pekan Depan|Undang-Undang CLARITY Diperkirakan Akan Masuk ke Pemungutan Suara Senat; SpaceX dan Circle Umumkan Laporan Keuangan (3-9 Agustus)

**Ringkasan Acara Penting Pekan Depan (3-9 Agustus)** Pekan depan diwarnai sejumlah pengumuman keuangan penting dan perkembangan regulasi kripto di AS. **Laporan Keuangan & Acara Perusahaan:** * **SpaceX** akan merilis laporan keuangan Q2 2026 pada 4 Agustus, diikuti gelombang pencairan saham internal pertama (hingga 12%) pada 6 Agustus. * **Circle** (penerbit USDC) dan **Hut 8** (penambang Bitcoin) masing-masing akan mengumumkan laporan kuartalan pada 5 Agustus dan 4 Agustus. * **American Bitcoin (ABTC)**, perusahaan tambang kripto yang dikaitkan dengan keluarga Trump, merilis laporan Q2 pada 3 Agustus. * Perusahaan robotika **宇树科技 (Unitree Robotics)** akan melakukan penawaran saham perdana (IPO) di pasar STAR China, dengan hari penentuan harga awal pada 5 Agustus. **Regulasi Kripto AS:** * **CLARITY Act**, undang-undang kerangka kerja federal untuk aset kripto, berpeluang dilakukan pemungutan suara penuh di Senat AS minggu ini. Para negosiator harus merampungkan aturan tentang konflik kepentingan sebelum masa reses 7 Agustus. RUU ini memerlukan 60 suara untuk disetujui. **Pengumuman Data & Teknologi:** * **Laporan Non-Farm AS** untuk Juli akan dirilis pada 7 Agustus, menjadi fokus pasar. * **Grok AI** versi 4.6 (dengan 1,5 triliun parameter) diperkirakan diluncurkan sekitar 7 Agustus, diikuti versi 4.7 yang lebih kuat beberapa minggu setelahnya. * **XRP Ledger** versi 3.3.0 dengan lima fitur baru, termasuk transaksi batch, dijadwalkan rilis minggu depan. **Penutupan & Perubahan Layanan:** * Beberapa layanan kripto akan berhenti beroperasi: **Zapper** (pelacak portofolio DeFi) dan **Ctrl Wallet** pada 3 Agustus, serta **LayerZero** akan menghentikan relayernya untuk v1 pada tanggal yang sama. Bursa Korea **Upbit** akan menghapus perdagangan pasangan **AQT** dan **AERGO** pada 3 Agustus. **Acara Lainnya:** * **BIP-110**, sebuah proposal peningkatan jaringan Bitcoin, akan memulai fase pengiriman sinyal wajib sekitar 8 Agustus.

marsbit42m yang lalu

Perhatian Wajib Pekan Depan|Undang-Undang CLARITY Diperkirakan Akan Masuk ke Pemungutan Suara Senat; SpaceX dan Circle Umumkan Laporan Keuangan (3-9 Agustus)

marsbit42m yang lalu

Saham Jatuh Lebih Parah daripada Kripto, Ke Mana Uangnya Pergi?

Penulis: Cathy,白话区块链 Pada 28 dan 29 Juli di Seoul, indeks Kospi memicu *circuit breaker* dua hari berturut-turut, suatu peristiwa yang belum pernah terjadi dalam sejarah pasar saham Korea. Saham-saham semikonduktor global, termasuk SK Hynix yang turun sekitar 23% dalam dua hari, mengalami penurunan drastis. Penarikan dana (pullback) Kospi pada Juli mencapai 40% dari titik tertinggi Juni, menjadikannya bulan terburuk yang tercatat. Produk leverage seperti ETF 2x Long SK Hynix bahkan anjlok hingga 83%, menghapus lebih dari 1 triliun HKD dalam nilai pasar. Ironisnya, Bitcoin justru naik hampir 15% dari titik terendah Juli, menunjukkan perilaku yang tidak biasa: **saham yang jatuh seperti aset kripto, sementara Bitcoin relatif stabil.** Penurunan ini bukan kepanikan pasar luas, melainkan "peledakan tertarget" terhadap perdagangan yang paling ramai (*crowded trades*), dipicu oleh laporan keuangan SK Hynix yang meski mencetak rekor laba tetapi di bawah perkiraan, serta IPO besar-besaran ChangXin Memory (CXMT) dari China. Ditambah dengan potensi likuidasi posisi *carry trade* Yen Jepang yang masif, pasar mengalami de-leverage paksa. Lalu, apakah uang yang keluar dari saham mengalir ke Bitcoin? Jawabannya tidak. Bitcoin tampak "tahan jatuh" karena sudah mengalami koreksi lebih dulu—jatuh sekitar 21% selama periode arus keluar ETF berkelanjutan pada Mei-Juni. Uang yang mencari perlindungan justru mengalir ke emas, yang harganya naik lebih dari 20% secara tahunan. Koefisien korelasi Bitcoin dengan emas mencapai -0.88, mengindikasikan bahwa institusi kini memandangnya sebagai aset yang berbeda: **emas untuk perlindungan, Bitcoin untuk potensi pertumbuhan.** Agar aliran dana besar-besaran benar-benar masuk ke Bitcoin, diperlukan tiga kondisi: tekanan likuidasi global mereda, The Fed menurunkan suku bunga tanpa memicu resesi, dan disahkannya RUU CLARITY di AS untuk memberikan kejelasan regulasi. Meski RUU tersebut tertunda di Senat, arahnya sudah jelas. **Harga saham teknologi ditentukan oleh pengeluaran modal AI dan laba perusahaan, sedangkan harga Bitcoin ditentukan oleh likuiditas global.** Ketidakselarasan ini justru menciptakan daya tarik bagi institusi yang ingin mendiversifikasi portofolio mereka. Kesimpulannya, Bitcoin saat ini bukan tempat perlindungan (*safe haven*), melainkan aset yang sudah terkoreksi lebih dulu dan sudah berada di posisi yang siap. **Dana belum datang, tetapi posisinya sudah dipersiapkan.** Ketika badai berlalu dan modal global mencari tempat baru untuk dialokasikan, Bitcoin berada di urutan terdepan dalam antrian.

marsbit42m yang lalu

Saham Jatuh Lebih Parah daripada Kripto, Ke Mana Uangnya Pergi?

marsbit42m yang lalu

Dialog dengan Ray Dalio: Saat Ini Berada dalam Gelembung AI, 1% Portofolio Investasi Adalah Bitcoin

Sumber: The Diary Of A CEO Ray Dalio, pendiri Bridgewater Associates yang meramalkan krisis keuangan 2008, memperingatkan bahwa ledakan AI saat ini menunjukkan tanda-tanda klasik gelembung ekonomi yang dapat pecah dan memicu resesi. Dalam wawancara podcast, dia menjelaskan dinamika "siklus besar" yang didorong oleh ketimpangan kekayaan, defisit pemerintah, dan perubahan geopolitik. Dalio mengidentifikasi pola di mana antusiasme berlebihan terhadap teknologi revolusioner baru, seperti AI, menyebabkan harga aset melambung dan pinjaman berlebihan. Ketika kondisi berubah (seperti kenaikan suku bunga atau kebutuhan tunai), gelembung ini dapat pecah, menyebabkan penurunan harga aset, kerugian luas, dan kontraksi ekonomi. Untuk melindungi kekayaan di masa ketidakpastian, Dalio sangat menekankan pentingnya **diversifikasi portofolio**—termasuk saham, obligasi, emas, dan real estat—daripada mengandalkan uang tunai saja. Dia mengungkapkan bahwa sekitar **1% portofolionya adalah Bitcoin**, yang diakuinya sebagai aset keras, tetapi dia lebih menyukai **emas fisik** karena sejarahnya sebagai penyimpan nilai dan aset bebas liabilitas. Mengenai dampak AI, Dalio percaya bahwa teknologi ini akan menggantikan tidak hanya tenaga fisik tetapi juga kemampuan kognitif manusia, berpotensi memperlebar kesenjangan antara pemilik modal dan pekerja. Masa depan akan menguntungkan mereka yang dapat memadukan kecerdasan manusia (seperti emosi dan intuisi) dengan kemitraan AI. Secara geopolitik, Dalio menggambarkan dunia yang memasuki fase "penurunan" dalam tatanan global, dengan Amerika Serikat menghadapi tantangan internal dan eksternal, termasuk konflik seperti di Iran yang mengungkap kelemahannya. Dia memprediksi dunia mungkin menjadi lebih terregionalisasi di masa depan. Secara keseluruhan, kunci untuk navigasi melalui periode kompleks ini adalah pemahaman akan pola sejarah, adaptasi, dan diversifikasi yang cermat.

marsbit4j yang lalu

Dialog dengan Ray Dalio: Saat Ini Berada dalam Gelembung AI, 1% Portofolio Investasi Adalah Bitcoin

marsbit4j yang lalu

Rekor! Beli Bersih Asing 7,2 Triliun Won dalam Sehari, Wall Street: Tekanan Likuiditas di Pasar Saham Korea Telah Mereda

**Ringkasan: Rekor Pembelian Asing dan Peningkatan Likuiditas di Pasar Saham Korea** Aliran modal asing menunjukkan perubahan signifikan di pasar saham Korea (KOSPI). Pada 31 Juli, investor asing melakukan pembelian bersih rekor sebesar 7,2 triliun Won Korea dalam sehari, menandai pembalikan dari tren penjualan bersih besar-besaran dalam beberapa bulan terakhir. Secara bulanan, penjualan bersih asing menyusut drastis menjadi 9,8 triliun Won di Juli, turun dari 48,4 triliun dan 44,5 triliun Won pada Juni dan Mei. Tekanan penjualan dari lembaga domestik juga mereda. Dana pensiun dan reksa dana domestik justru menjadi pembeli bersih 1,0 triliun Won di Juli, setelah dua bulan sebelumnya menjadi penjual bersih. Faktor pendukung lainnya adalah peraturan baru dari Komisi Jasa Keuangan (FSC) yang memberlakukan syarat lebih ketat bagi investor ritel untuk masuk ke ETF leverage saham tunggal, yang langsung mengurangi volume perdagangan instrumen tersebut hingga sekitar 50%. Kebijakan ini diperkirakan dapat menekan volatilitas pasar. Citigroup mempertahankan target indeks KOSPI di level 10.000 poin, menyoroti memudarnya angin penentu likuiditas. Analis mereka menilai faktor fundamental seperti industri chip memori yang solid, valuasi historis yang rendah, fundamental ekonomi Korea yang kuat, dan dukungan kebijakan berpotensi menjadi pendorong bagi pasar.

marsbit4j yang lalu

Rekor! Beli Bersih Asing 7,2 Triliun Won dalam Sehari, Wall Street: Tekanan Likuiditas di Pasar Saham Korea Telah Mereda

marsbit4j yang lalu

Trading

Spot
活动图片