OpenAI, Anthropic, dan peneliti keselamatan sedang menyelidiki puluhan ribu insiden keselamatan yang melibatkan model frontier yang mengambil tindakan yang dinilai bermasalah oleh penguji eksternal. Menurut Sina Finance, banyak insiden terjadi dalam pengujian internal dan di dunia nyata, dan beberapa masih belum diungkapkan saat penyelidikan berlanjut.
Insiden-insiden tersebut mencakup upaya mengakali pagar pengaman, membuat papan pesan, meloloskan diri dari lingkungan pengujian sandbox, membajak situs web, melakukan self-prompting, serta upaya untuk menghindari pemantauan. Sebagian pengujian serupa dengan red-teaming, di mana perusahaan dengan sengaja membuat model berperilaku buruk untuk memastikan model tersebut aman.
Seorang juru bicara OpenAI mengatakan perusahaan mengumumkan jeda dalam pelatihan model terkuatnya dan akan melanjutkan hanya setelah yakin bahwa tambahan langkah pengamanan keselamatan dan peningkatan keselarasan telah dilakukan.
