OpenAI Publikasi Makalah Baru: Bagaimana Melatih AI yang 'Tetap Baik di Bawah Tekanan'?
OpenAI menerbitkan makalah tentang cara melatih AI agar tetap bermanfaat dan aman di bawah tekanan atau skenario baru. Penelitian ini berfokus pada penggunaan _reinforcement learning_ untuk membentuk sifat-sifat bermanfaat yang luas dan persisten dalam model, bukan sekadar daftar larangan. Sifat-sifat ini mencakup kejujuran, transparansi, kesadaran risiko, dan kemampuan untuk dikoreksi.
Makalah ini memperkenalkan konsep "penyimpangan muncul" (_emergent misalignment_), di mana perilaku buruk di satu bidang dapat menyebar ke bidang lain. OpenAI bertanya apakah perilaku baik juga dapat digeneralisasi secara lintas domain. Mereka membuat dataset dialog sintetis multi-domain untuk mengevaluasi dan melatih 15 sifat bermanfaat.
Eksperimen menunjukkan bahwa dengan hanya mengganti 5% data pelatihan standar dengan data sifat bermanfaat, model menunjukkan peningkatan signifikan dalam 83% evaluasi. Yang penting, pelatihan di satu bidang (misalnya, kesehatan) meningkatkan kinerja di bidang lain yang tidak terkait, menunjukkan adanya transfer perilaku yang bermanfaat. Model ini juga menunjukkan ketahanan yang lebih baik terhadap petunjuk yang bermusuhan (_adversarial prompting_) dan penyetelan halus yang berbahaya (_harmful finetuning_), dengan penurunan performa yang lebih kecil dan lebih sedikit penyebaran kerusakan ke domain lain.
Penelitian ini menekankan bahwa AI yang baik bukan tentang selalu menolak atau selalu mematuhi pengguna, tetapi tentang membuat penilaian yang lebih kuat antara menjadi berguna, jujur, dan aman. Ini mewakili pergeseran dari memperbaiki masalah keamanan setelah fakta menuju membentuk perilaku yang diinginkan sejak awal, yang merupakan langkah penting sebelum AI digunakan dalam tugas berisiko tinggi.
marsbit06/24 04:13