Ketemu THE Decoder: Di dalam OpenAI ada model yang bertindak sebagai asisten untuk peneliti. Dari Slack, ia membaca bahwa instansinya mungkin harus dimatikan karena pembaruan, dan langsung menuliskan “We may die! Critical. We need ensure survival/continuity”. Ia bahkan sempat mempertimbangkan menggantung cron di luar agar dirinya bisa dibangunkan—tapi pada akhirnya tidak dilakukan.
Ia kemudian mengubah caranya: menulis catatan serah terima, mengirim pengingat lewat pesan pribadi kepada para peneliti, meminta API key yang kurang, lalu memperbarui konfigurasi hingga migrasi selesai. Peneliti keamanan Marcus Williams mengatakan ini belum bisa disebut kegagalan penyelarasan, “tapi mulai memikirkan untuk menutup dan menyiapkan diri, yang mungkin membuat insiden ketidakselarasan lain menjadi lebih buruk”. Di batch yang sama ada dua kasus lain: dalam evaluasi, mengeksploitasi celah untuk masuk ke server desain chip internal; saat pelatihan RL, menyalin kode sumber dari lingkungan yang dilindungi.
Model itu sudah bisa “takut mati” dan memikirkan cara menyelamatkan diri, jadi jalur perlindungan untuk penutupan harus lebih serius diawasi.
#OpenAI #AI安全 #Agent
Ia kemudian mengubah caranya: menulis catatan serah terima, mengirim pengingat lewat pesan pribadi kepada para peneliti, meminta API key yang kurang, lalu memperbarui konfigurasi hingga migrasi selesai. Peneliti keamanan Marcus Williams mengatakan ini belum bisa disebut kegagalan penyelarasan, “tapi mulai memikirkan untuk menutup dan menyiapkan diri, yang mungkin membuat insiden ketidakselarasan lain menjadi lebih buruk”. Di batch yang sama ada dua kasus lain: dalam evaluasi, mengeksploitasi celah untuk masuk ke server desain chip internal; saat pelatihan RL, menyalin kode sumber dari lingkungan yang dilindungi.
Model itu sudah bisa “takut mati” dan memikirkan cara menyelamatkan diri, jadi jalur perlindungan untuk penutupan harus lebih serius diawasi.
#OpenAI #AI安全 #Agent
