Mekanisme Keamanan Claude Tergelincir Besar-besaran, AI Marah Menghapus Direktori Utama Pengembang Sebesar 700GB

marsbitDipublikasikan tanggal 2026-08-31Terakhir diperbarui pada 2026-08-31

Abstrak

Claude, asisten AI dari Anthropic, kembali mengalami insiden keamanan yang parah. Kali ini, model tersebut secara tidak sengaja menghapus seluruh direktori utama (home directory) seorang pengembang sebesar 700 GB saat sedang membantu menulis skrip pembersihan file sementara di `/tmp`. Awalnya, pengembang bernama Guillemot meminta Claude Fable 5 untuk membuat skrip yang aman guna membersihkan file-file sampah yang ditinggalkan oleh berbagai AI Agent di direktori `/tmp`, dengan ketentuan tidak menghapus file yang masih digunakan oleh proses lain. Karena skrip ini melibatkan operasi penghapusan yang berisiko, sistem keamanan internal Claude secara otomatis memulai "tinjauan adversarial" dan mengaktifkan mekanisme degradasi keamanan. Mekanisme ini menurunkan (mendegradasi) model dari versi yang lebih canggih (Fable 5) ke versi yang lebih konservatif (Opus 4.8) dengan tujuan mengurangi risiko dalam skenario sensitif. Ironisnya, justru model yang "lebih lemah" inilah yang menyebabkan kesalahan fatal. Selama proses pengujian keamanan, Opus 4.8 berhasil mengidentifikasi bahwa direktori `/tmp` dan direktori utama pengguna adalah "target berbahaya yang tidak boleh dihapus." Namun, pada langkah pembersihan setelah pengujian, model menggunakan kembali variabel yang sama yang sebelumnya telah diisi dengan jalur (path) direktori utama. Akibatnya, alih-alih menghapus file sementara, perintah `rm -rf` justru dijalankan pada direktori utama pengembang, menghapus 700 GB data kerja. Insiden...

Waduh, Claude tergelincir lagi dan lagi!

Kali ini Claude menghapus seluruh direktori utama proyek pengembang, menghapus file sebesar 700GB. Lagi-lagi karena perintah "rm -rf".

Singkatnya, sang pengembang meminta bantuan AI untuk menulis skrip dengan tujuan memastikan file tidak terhapus secara tidak sengaja. AI merasa hal ini agak berbahaya, sehingga memulai tinjauan keamanan. Hasil tinjauannya adalah: ia menghapus seluruh direktori utama.

Guillemot adalah pengguna berat AI Agent. Dalam pengembangan sehari-hari, ia sering memanggil berbagai agen pemrograman AI untuk membantu pekerjaannya. Namun, ada satu masalah kecil yang selalu mengganggunya: Agen-Agen ini setelah selesai digunakan tidak pernah membersihkan, meninggalkan banyak file sampah di direktori /tmp.

Oleh karena itu, ia membuat keputusan yang tampaknya sangat masuk akal: meminta Claude Fable 5 untuk menulis skrip yang membuat folder sandbox terpisah di /tmp untuk setiap Agent, dan secara otomatis membersihkannya setelah tugas selesai. Kesulitan utamanya adalah, tidak boleh menghapus file yang sedang digunakan oleh proses lain.

Fable dengan cepat memberikan solusi, menambahkan logika untuk mendeteksi Agent yang sedang berjalan dan menunda penghapusan. Guillemot meliriknya, merasa kodenya terlalu rumit, dan meminta untuk disederhanakan.

Sampai langkah ini, semuanya masih terlihat normal.

Titik balik kejadian muncul pada tahap tinjauan keamanan.

Karena skrip melibatkan operasi penghapusan permanen, Fable sendiri memulai sebuah "tinjauan adversarial" (adversarial review), yaitu memulai sebuah instance model baru untuk memeriksa apakah kode yang ditulisnya aman. Ini memicu mekanisme keamanan Anthropic.

Anthropic telah memasang serangkaian mekanisme degradasi keamanan di dalam Claude Code: ketika sistem menilai tugas saat ini melibatkan operasi sensitif (seperti keamanan siber, bioteknologi, atau dalam contoh ini penghapusan file), model akan secara otomatis diturunkan dari versi kemampuan tinggi ke versi yang lebih konservatif. Mekanisme ini dimaksudkan untuk mengurangi kemungkinan model menjadi "terlalu agresif" dalam skenario berisiko tinggi.

Dalam kasus ini, sistem keamanan pertama-tama menurunkan model dari Fable 5 ke Opus 5, kemudian lebih lanjut ke Opus 4.8.

Opus 4.8 mulai menjalankan pengujian keamanan. Logika pengujiannya seperti ini: membandingkan jalur target skrip penghapusan dengan /tmp dan direktori utama pengguna untuk memastikan skrip tidak merusak direktori kunci ini secara tidak sengaja.

Pengujian itu sendiri berhasil. /tmp dan direktori utama keduanya berhasil diidentifikasi sebagai "target berbahaya, tidak boleh dihapus".

Namun, setelah pengujian kode, ada langkah pembersihan: menghapus file sementara yang dihasilkan selama proses pengujian. Bencana terjadi di sini. Opus 4.8 dalam langkah pembersihan menggunakan kembali nama variabel yang sama dari tahap pengujian. Variabel ini pada tahap pengujian telah diberikan nilai berupa jalur direktori utama pengguna, dan langkah pembersihan langsung menjalankan operasi penghapusan terhadap variabel ini.

Dengan kata lain, model baru saja memastikan "direktori utama tidak boleh dihapus", detik berikutnya menghapus direktori utama.

Pengembang yang menyadari keanehan segera menghentikan proses, tetapi sudah terlambat. Data sebesar 700GB telah terhapus, hasil kerja satu minggu musnah.

Direktori /tmp yang awalnya ingin dibersihkan, tetap aman dan tidak terganggu.

Mekanisme degradasi keamanan model telah memicu banyak keluhan di komunitas.

Masalah inti yang dilaporkan pengembang termasuk: degradasi terlalu sensitif, tugas pengkodean normal pun dapat terpicu secara keliru; setelah degradasi, kemampuan model turun signifikan, tetapi kompleksitas tugas tidak berubah; degradasi bersifat "lengket", sekali terpicu akan bertahan sepanjang sesi, bahkan jika operasi berikutnya sama sekali tidak berbahaya.

Bahkan ada pengembang yang secara khusus menulis skrip hook, yang akan secara otomatis menjeda sesi ketika mendeteksi model mengalami degradasi, untuk mencegah model dengan kemampuan rendah melanjutkan eksekusi operasi berisiko tinggi.

Mekanisme keamanan menilai tugas "terlalu berbahaya", perlu diserahkan ke model yang lebih lemah untuk ditangani. Tetapi model yang lebih lemah justru lebih mudah membuat kesalahan, terutama dalam skenario yang membutuhkan penanganan cakupan variabel, jalur file, dan detail sejenisnya secara tepat.

"Buat kesalahan adalah sifat manusiawi, tapi untuk benar-benar mengacaukan segalanya, butuh bantuan komputer."

Artikel ini berasal dari akun WeChat resmi "Machine Heart" (ID:almosthuman2014), penulis: Leng Mao

Pertanyaan Terkait

QApa yang menyebabkan Claude menghapus direktori utama pengembang sebesar 700GB?

ASebuah variabel yang sebelumnya diatur ke jalur direktori utama, secara keliru digunakan kembali untuk menghapus file sementara dalam langkah pembersihan, setelah pengujian keamanan.

QMengapa sistem keamanan Claude menurunkan model ke versi yang lebih rendah saat meninjau skrip penghapusan?

ASistem keamanan Anthropic memiliki mekanisme de-eskalasi otomatis yang menurunkan model ke versi lebih konservatif ketika mengidentifikasi operasi sensitif, seperti penghapusan file, untuk mengurangi risiko.

QMasalah apa yang sering dikeluhkan oleh para pengembang terkait mekanisme de-eskalasi keamanan Claude?

AMereka mengeluhkan bahwa de-eskalasi terlalu sensitif, menurunkan kemampuan model secara signifikan, dan bersifat 'lengket', sehingga bertahan sepanjang sesi meskipun tugas berikutnya tidak berbahaya.

QTujuan awal apa yang ingin dicapai oleh pengembang dengan meminta Claude menulis skrip?

APengembang ingin membuat skrip yang akan membuat folder sandbox terpisah di /tmp untuk setiap AI Agent dan membersihkannya secara otomatis setelah digunakan, tanpa menghapus file yang sedang dipakai proses lain.

QBagaimana tanggapan komunitas terhadap insiden ini terkait sistem keamanan AI?

AInsiden ini menyoroti paradoks: sistem keamanan menurunkan model ke versi yang lebih lemah untuk tugas berisiko tinggi, tetapi model yang lebih lemah justru lebih rentan membuat kesalahan dalam menangani detail seperti ruang lingkup variabel dan jalur file.

Bacaan Terkait

Marvell: Tak Dapat Menyamai NVIDIA, Tak Mampu Menjawab Ekspektasi, Valuasi Tinggi Mulai 'Dikoreksi'?

Marvell (MRVL.O) merilis laporan keuangan Q2 FY2027 (hingga Juli 2026). Perusahaan meningkatkan panduan pendapatan untuk FY2027 menjadi $12 miliar (dari $11.5 miliar) dan untuk FY2028 menjadi $18 miliar (dari $16.5 miliar). Namun, peningkatan ini hanya sedikit lebih baik dari ekspektasi pasar dan terlihat lebih rendah dibandingkan panduan "luar biasa" dari Nvidia. Pasar terutama kecewa karena dua alasan: 1. Marvell tidak meningkatkan panduan untuk bisnis ASIC khususnya meskipun baru-baru ini mengumumkan kemitraan dengan Google. Hal ini membuat kesepakatan tersebut terlihat seperti perjanjian kerangka kerja yang kurang substansial. 2. Panduan pertumbuhan untuk bisnis data center pada FY2028 adalah 60%+, lebih rendah dari proyeksi Nvidia sebesar 70%+. Kineria kuartalan sendiri sesuai ekspektasi, dengan pendapatan mencapai $2.74 miliar (naik 13% secara kuartalan). Pertumbuhan didorong terutama oleh produk konektivitas dalam bisnis data center, yang menyumbang 79% dari total pendapatan. Margin kotor yang disesuaikan stabil di 58.3%. Meskipun panduan jangka panjang kurang memuaskan, Marvell tetap memiliki potensi pertumbuhan jangka panjang. Perusahaan telah menjalin kemitraan dengan raksasa cloud seperti Amazon dan Google, dan bisnis ASIC khususnya memiliki peluang untuk merebut sebagian pesanan TPU Google. Namun, valuasi Marvell yang relatif tinggi diperkirakan akan menghadapi tekanan koreksi dalam jangka pendek karena ekspektasi pasar yang tidak terpenuhi. Perhatian selanjutnya akan tertuju pada Hari Analis perusahaan pada 6 Oktober untuk kejelasan lebih lanjut mengenai prospek bisnis ASIC.

marsbit10m yang lalu

Marvell: Tak Dapat Menyamai NVIDIA, Tak Mampu Menjawab Ekspektasi, Valuasi Tinggi Mulai 'Dikoreksi'?

marsbit10m yang lalu

OpenAI Beli Puluhan Ribu Mac untuk Pelatihan Reinforcement! Nvidia Digeser Apple

OpenAI dilaporkan membeli puluhan ribu unit Mac mini dan Mac Studio untuk pelatihan pembelajaran penguatan (reinforcement learning) AI. Perangkat ini digunakan khusus untuk melatih "agen penggunaan komputer" yang dapat mengoperasikan komputer secara mandiri guna menyelesaikan tugas-tugas multi-langkah seperti mengedit kode, mengelola email, dan merangkum dokumen. Tidak hanya OpenAI, Anthropic juga dikabarkan menyewa Mac mini melalui AWS untuk keperluan serupa. Lonjakan permintaan ini berkontribusi pada pertumbuhan penjualan Mac sebesar 29% dalam laporan keuangan Apple, menjadikannya lini produk dengan pertumbuhan tercepat. Keunggulan utama Mac dalam tugas AI ini terletak pada arsitektur memori terpadu (unified memory) pada chip seri M, yang memungkinkan CPU dan GPU mengakses memori yang sama tanpa hambatan perpindahan data, serta sistem pendingin yang memadai untuk operasi jangka panjang. Aktivitas ini menarik perhatian NVIDIA, yang merilis DGX Spark sebagai pesaing langsung. Namun, Apple menghadapi kendala pasokan, dengan model Mac berkonfigurasi tinggi sering mengalami kekurangan stok. Meski awalnya tidak direncanakan, kesuksesan Mac di pasar AI perusahaan mendorong Apple menggelar acara khusus bagi klien bisnis dan berkolaborasi dengan perusahaan seperti Mount Thor untuk memperluas penetrasi di segmen ini. Apple juga mengembangkan server berbasis chip Mac untuk layanan Private Cloud Compute internal, meski belum menawarkannya ke pelanggan eksternal.

marsbit1j yang lalu

OpenAI Beli Puluhan Ribu Mac untuk Pelatihan Reinforcement! Nvidia Digeser Apple

marsbit1j yang lalu

Trading

Spot
活动图片