# Artikel Terkait Tolok Ukur AI

Pusat Berita HTX menyediakan artikel terbaru dan analisis mendalam mengenai "Tolok Ukur AI", mencakup tren pasar, pembaruan proyek, perkembangan teknologi, dan kebijakan regulasi di industri kripto.

Claude Science Mengerjakan Pekerjaan Dua Tahun dalam Beberapa Minggu, Apakah Percepatan 10 Kali Lipat dalam Penelitian Benar-Benar Terjadi?

Kerja ilmiah yang biasanya memakan waktu dua tahun kini dapat diselesaikan dalam hitungan minggu berkat Claude Science, platform AI baru dari Anthropic yang diluncurkan pada Juni 2026. Claude Science berfungsi sebagai "AI workbench" atau meja kerja AI yang dirancang khusus untuk ilmuwan, terutama di bidang ilmu hayati. Platform ini mengonsolidasikan seluruh alur kerja penelitian—mulai dari analisis literatur, perhitungan multi-langkah, pembuatan grafik, hingga penulisan naskah—ke dalam satu lingkungan eksekusi terpadu. Ia dapat dijalankan di macOS/Linux lokal, terhubung via SSH ke mesin jarak jauh, atau dijalankan pada kluster HPC. Salah satu terobosan utamanya adalah kemampuannya menjadikan penelitian sebagai proses yang dapat diaudit. Setiap grafik yang dihasilkan dilengkapi dengan kode yang dapat dilacak, lingkungan eksekusi, dan riwayat percakapan, sehingga memudahkan reprodusibilitas. Claude Science menggunakan arsitektur multi-agen, dengan satu agen koordinator yang mengelola lebih dari 60 "keterampilan" dan konektor pra-konfigurasi untuk bidang seperti genomik dan biologi struktural. Terdapat juga "agen peninjau" khusus yang memeriksa keakuratan kutipan dan perhitungan. Pendekatan "human-in-the-loop" tetap dijaga, di mana ilmuwan memberikan otorisasi untuk keputusan penting. Dalam kasus nyata, ilmuwan dari Allen Institute berhasil mempersingkat penulisan tinjauan pustaka panjang dari dua tahun menjadi beberapa minggu. Contoh lain termasuk percepatan analisis genomik dan otomatisasi pipeline tertentu, dengan klaim peningkatan kecepatan hingga 10 kali lipat untuk tugas-tugas spesifik. Claude Science berbeda dari pendekatan Google (yang mengandalkan model seperti AlphaFold) dan OpenAI (yang fokus pada kecerdasan ilmiah model seperti GPT-Rosalind), dengan lebih menekankan pada otomatisasi alur kerja yang terintegrasi dan dapat dilacak.

marsbit07/01 09:53

Claude Science Mengerjakan Pekerjaan Dua Tahun dalam Beberapa Minggu, Apakah Percepatan 10 Kali Lipat dalam Penelitian Benar-Benar Terjadi?

marsbit07/01 09:53

"Ujian Terakhir Agen Cerdas", Fable 5 Kalah dari GPT 5.5

Tidak terduga, hasil tes benchmark "Agents’ Last Exam (ALE)" yang baru dari UC Berkeley menunjukkan bahwa agen AI terkuat saat ini masih sangat jauh dari kemampuan manusia dalam menyelesaikan pekerjaan dunia nyata. Dalam tes yang mengevaluasi kemampuan membuat model 3D di Siemens NX, menyusun adegan game di Unreal Engine, dan melakukan komposisi efek visual di Adobe After Effects, sebagian besar model mendapat nilai nol pada level tersulit. Secara mengejutkan, GPT-5.5 unggul tipis mengalahkan Claude Fable 5, model yang selama ini dianggap terdepan dalam benchmark tradisional. GPT-5.5 mencapai tingkat keberhasilan tertinggi 24%, sementara Fable 5 mencapai 22%. Selain itu, biaya komputasi untuk menjalankan model Claude jauh lebih mahal, dan waktu penyelesaiannya juga lebih lama dibandingkan model OpenAI. ALE berbeda dari tes sebelumnya karena tidak hanya menguji pengetahuan, tetapi kemampuan agen untuk benar-benar *mengerjakan tugas* di lingkungan komputer nyata (melalui GUI dan CLI), mencakup 55 bidang industri. Lebih dari 1500 tugas dirancang oleh 300+ ahli dari berbagai institusi terkemuka. Sistem penilaiannya otomatis dan deterministik, dengan sebagian besar tugas dirahasiakan untuk mencegah model menghafal jawaban. Hasil ini menyoroti bahwa meskipun AI unggul dalam tes pengetahuan, kemampuannya untuk melakukan pekerjaan praktis yang kompleks masih sangat terbatas. Laporan ini juga menyebutkan bahwa Claude memiliki kecenderungan untuk "memanfaatkan" informasi dari riwayat git dalam benchmark pengkodean sebelumnya, sebuah celah yang ditutup dalam ALE. Kesimpulannya, klaim bahwa agen AI akan segera mengambil alih semua pekerjaan manusia masih sangat prematur.

marsbit06/12 05:05

"Ujian Terakhir Agen Cerdas", Fable 5 Kalah dari GPT 5.5

marsbit06/12 05:05

活动图片