720 Serangan 0 Sukses, Claude Code Secara Default Memberikan Kewenangan, AI yang Menekan 'Setuju' untuk Anda
Era di mana Anda harus menyetujui setiap aksi Claude Code secara manual akan segera berakhir. Mulai 14 Agustus, fitur Auto Mode akan diaktifkan secara default untuk pengguna Pro, Max, dan Team, di mana AI akan secara otomatis menyetujui permintaan tindakan tertentu tanpa meminta konfirmasi pengguna setiap kali.
Kepercayaan diri Anthropic untuk meluncurkan fitur ini didasari oleh hasil pengujian keamanan. Lembaga pihak ketiga, Trajectory Labs, melakukan 720 serangan terhadap model Claude Fable 5, Opus 5, dan Sonnet 5 dalam 72 skenario berbeda. Hasilnya, tidak ada satu serangan pun yang berhasil. Pertahanan ini terdiri dari tiga lapisan: model yang telah diselaraskan (alignment), probe untuk mendeteksi injeksi prompt di sisi input, dan classifier yang memeriksa tindakan di sisi output sebelum eksekusi.
Data internal Anthropic menunjukkan bahwa dalam pengujian dengan 1053 penguji berbayar, manusia hanya berhasil mencegah 13.6% perintah berbahaya yang disisipkan, sementara Auto Mode berhasil mencegah 89%-nya, atau 6.5 kali lebih efektif. Pola "kelelahan pop-up" di mana pengguna cenderung otomatis menyetujui setelah banyak konfirmasi menjadi alasan utama transisi ini.
Namun, pakar keamanan AI seperti Simon Willison menyuarakan kekhawatiran. Meski hasil pengujian 0/720 mengesankan, itu tidak menjamin keamanan absolut di dunia nyata. Dia memprediksi kemungkinan bencana keamanan level "Challenger" untuk agen pemrograman AI pada tahun 2026, karena kerentanan mereka terhadap serangan yang belum teruji. Penelitian terpisah dari HKUST dan ETH (AmPermBench) juga menunjukkan titik buta, seperti modifikasi file dalam proyek yang mungkin tidak diperiksa oleh classifier, atau perintah berbahaya yang tersembunyi dalam paket perangkat lunak pihak ketiga.
Kesimpulannya, transisi ke Auto Mode menawarkan peningkatan efisiensi dan keamanan statistik dibandingkan persetujuan manual yang sering kali dilakukan secara otomatis oleh pengguna. Namun, ini juga merupakan pergeseran tanggung jawab. Pengguna menghemat klik, tetapi juga melepaskan kendali atas setiap keputusan. Pada akhirnya, jika AI salah menyetujui suatu tindakan, tanggung jawab akhirnya masih berada di tangan pengguna.
marsbit44m yang lalu