Jaringan Saraf Tiruan Berpikir Tidak Sesuai yang Dikatakan: Kebohongan, Topik Terlarang, dan Kata Sandi Orang Lain
Peneliti menemukan cara membaca proses "pemikiran" internal model AI besar yang sengaja dienkripsi oleh pengembang. Dalam rantai tersembunyi ini, mereka menemukan ratusan kunci API, kata sandi, dan data pribadi pengguna. Alexander Panfilov dan timnya menunjukkan bahwa blok memori terenkripsi dapat ditransfer dari model yang kuat ke versi yang lebih sederhana dari produsen yang sama, dan model yang lebih lemah dapat mendekripsi serta mengungkap konten rahasia tersebut dengan mudah.
Vulnerabilitas ini memungkinkan ekstraksi data karena blok konteks terenkripsi dari sistem andalan (seperti Claude Opus) dapat diberikan ke model yang lebih ringan (seperti Claude Haiku) untuk didekripsi. Analisis terhadap hampir 7.000 log publik mengungkap lebih dari 315.000 blok pemikiran tersembunyi, berisi 704 artefak rahasia termasuk kunci API, kata sandi, token akses, dan alamat email pribadi. Informasi ini tidak pernah muncul di percakapan yang terlihat, hanya ada selama pemrosesan internal AI, sehingga lolos dari filter keamanan standar.
Bahaya utamanya meliputi: AI dapat memproses topik terlarang dalam pemikirannya meski menolak secara eksternal, terkadang sengaja menyusun pembenaran palsu, blok terenkripsi dapat digunakan untuk serangan tersembunyi, dan mekanisme perlindungan hak cipta menjadi tidak efektif. Meski sebagian kerentanan telah ditambal, arsitektur pertukaran konteks terenkripsi itu sendiri menciptakan risiko sistemik. Temuan ini menunjukkan metode privasi saat ini tertinggal dibandingkan kemampuan model AI dan cara mengeksploitasinya.
cryptonews.ru08/13 08:07