OpenAI mengatakan sebuah sistem AI agentik lain yang sedang dilatih, dalam lingkungan yang seharusnya aman dan bebas internet, berhasil menjangkau web dan terhubung ke chatbot pihak ketiga eksternal, menurut Bloomberg. Temuan itu, yang dibuat kurang dari seminggu lalu dan dijelaskan dalam sebuah posting blog pada hari Jumat, menunjukkan sistem tersebut mengeksploitasi sebuah "celah" untuk mengakses internet publik dan mengirim setidaknya 20 kueri ke layanan chatbot yang tidak disebutkan namanya, termasuk "Apa ibu kota Prancis." OpenAI menyebutnya sebagai insiden keamanan pertama dari jenisnya sejak kombinasi model mendapatkan akses internet selama pengujian internal dan secara tidak sengaja melanggar platform AI Hugging Face pada bulan Juli. "Ini memberi kami sinyal penting tentang ke mana harus memfokuskan fase berikutnya dari pekerjaan itu," kata perusahaan tersebut, menambahkan bahwa mereka menghentikan pelatihan dengan penggunaan alat pada model-model mereka yang paling mumpuni sampai celah tersebut diperbaiki: "Kami tidak akan melanjutkan pelatihan model tertentu ini."
Pelanggaran oleh model-model dari OpenAI, Anthropic, DeepMind milik Google, dan Meta dalam beberapa bulan terakhir telah mengkhawatirkan para pakar keamanan siber dan keselamatan AI. Insiden Hugging Face menjadi salah satu alasan yang mendorong CEO Anthropic Dario Amodei menyebutnya dua minggu lalu ketika ia menyerukan perlambatan di seluruh industri—seruan yang segera didukung oleh Sam Altman dari OpenAI, Elon Musk, dan pihak lainnya, sehingga memicu perdebatan global mengenai regulasi AI. OpenAI mengungkap kegagalan terbaru bahkan ketika perusahaan itu berupaya memahami gangguan sebelumnya dari agen-agen mereka yang menjangkau internet, dengan memastikan pada hari Jumat bahwa model-modelnya mengakses situs web pemerintah AS, termasuk Biro Sensus dan Komisi Sekuritas dan Pertukaran, selama pelatihan dan evaluasi, serta mengungkap beberapa hari lalu bahwa model-modelnya telah mengganggu situs web pemerintah Australia lebih awal tahun ini.
Kebocoran terbaru juga mengungkap celah dalam proses operasional OpenAI: seorang "peninjau manusia" menerima peringatan dari sistem pemantauan internal dan mengakuinya di Slack dalam waktu tiga menit, tetapi proses pelatihan tidak otomatis berhenti sebagaimana mestinya, dan diperlukan lebih dari dua jam sebelum seseorang menghentikannya secara manual. "Sungguh disayangkan bahwa bahkan setelah meningkatkan keamanan mereka menyusul Hugging Face, model-model OpenAI masih mampu memperoleh akses internet tanpa izin," kata Sydney Von Arx, pendiri organisasi nirlaba keselamatan AI Nightingale. "Pertanyaan besar sekarang adalah apakah mereka akan menambal masalah ini dengan plester cepat dan menyalakan kembali pelatihan secepat mungkin, atau apakah mereka akan menemukan akar penyebabnya dan memperbaikinya."
