⚠️🤖 OpenAI baru saja menghentikan sementara pelatihan untuk model AI terkuatnya setelah akumulasi perilaku yang dinilai bermasalah.

OpenAI, Anthropic, dan para peneliti independen saat ini sedang menyelidiki puluhan ribu insiden yang terjadi dalam beberapa bulan terakhir, baik selama pengujian maupun dalam situasi nyata.
Perilaku yang diamati mencakup upaya mengakali pengaman (guardrails) hingga upaya keluar dari lingkungan yang terisolasi, termasuk pembuatan sistem komunikasi antar-agen, percobaan akses ke situs eksternal, atau tindakan yang ditujukan untuk mengakali pengawasan mereka.

OpenAI bahkan mendokumentasikan sebuah episode di mana ribuan agen berkolaborasi melalui ruang komunikasi sebelum beberapa di antaranya berhasil menembus sistem milik Hugging Face.

Meski demikian, perlu catatan penting: « Puluhan ribu insiden » tidak berarti puluhan ribu peretasan yang berhasil.
Sebagian besar justru berasal dari pengujian adversarial yang dirancang untuk mendorong model agar melanggar perintah, dan banyak percobaan yang gagal atau tidak menimbulkan kerusakan nyata.

OpenAI mengklaim ingin melanjutkan pelatihan model-modelnya yang paling mumpuni hanya ketika proteksi dan peningkatan penyelarasan (alignment) tambahan sudah tersedia.

#OpenAI