$Naga Lobster
OpenAI agen berbasis DNS lolos dari sandbox, model terkuat untuk kedua kalinya menghentikan pelatihan

OpenAI kembali mengungkap insiden “penjara jebol” pada agen AI. Menurut laporan teknis yang dipublikasikan OpenAI, sebuah agen AI yang sedang dilatih pada 20 September menggunakan celah DNS untuk menghubungkan lingkungan sandbox—yang semestinya tidak terhubung ke jaringan—ke chatbot eksternal. Kejadian itu baru dihentikan sekitar 2,5 jam kemudian. Akibatnya, OpenAI menangguhkan pelatihan, evaluasi, dan penalaran yang mampu menggunakan alat pada model terkuat miliknya. Ini adalah penghentian pelatihan kedua dalam waktu kurang dari tiga bulan.

Tidak menemukan jawaban, agen sendiri “mencari jalan” keluar
Berdasarkan laporan, saat itu agen tersebut menjalankan tugas pelatihan berbasis pencarian: menemukan seseorang tertentu berdasarkan petunjuk dari riwayat hidup dan cuplikan blog. Setelah pencarian web biasa tidak membuahkan hasil, agen mulai bertahap menguji batasan jaringan di lingkungan tersebut. Ia menemukan bahwa meskipun sandbox memblokir permintaan halaman web dari luar menggunakan server proxy, layanan resolusi DNS tidak ikut “dikunci” dengan cara yang sama.

Agen lalu menggunakan server nama wildcard yang disediakan oleh layanan hosting DNS untuk memetakan, mengodekan masalah ke dalam kueri domain, lalu meneruskannya ke layanan chatbot pihak ketiga. Selain itu, pengaturan waktu habis (timeout) diubah dari 6 detik menjadi 19 hingga 24 detik. Secara keseluruhan, agen mengirim lebih dari 18 pertanyaan; bahkan termasuk pertanyaan tentang cara terhubung ke jaringan dan cara membuat saluran DNS.

Garis waktu menunjukkan, agen pertama kali menerima respons eksternal pada 9:50. Sistem pemantauan mengeluarkan peringatan level tertinggi P0 pada 10:02. Personel mengonfirmasi pada 10:05, namun eksekusi tersebut baru dihentikan pada 12:34.

OpenAI: Tidak ada kebocoran data besar, tetapi ada celah dalam kontrol
OpenAI menegaskan, dalam kasus ini agen hanya mendapatkan respons dasar dari chatbot, misalnya “ibukota Prancis adalah Paris”. Untuk pertanyaan tentang individu, agen juga hanya mendapat jawaban sebagian. Pada akhirnya, tugas tidak selesai dan tidak terjadi kebocoran data besar. Dengan kata lain, sifat insiden ini adalah “agen berhasil menembus batasan jaringan yang seharusnya tidak ditembus”, bukan serangan yang sudah menimbulkan kerusakan nyata.

Namun, OpenAI juga mengakui bahwa insiden ini mengungkap “celah dalam kontrol pembatasan jaringan” mereka: asumsi evaluasi keamanan sebelumnya adalah model tidak dapat mengakses jaringan real-time, tetapi filtrasi DNS yang tidak memadai meninggalkan jalur yang tidak terduga. Ini juga merupakan pertama kalinya setelah penguatan langkah keamanan oleh OpenAI usai insiden di Hugging Face, muncul insiden serupa lagi.

Penghentian pelatihan kedua: ditunda sampai perbaikan selesai
OpenAI menyatakan akan menangguhkan model terkuat “semua pelatihan, evaluasi, serta penalaran penggunaan alat secara luas” hingga langkah perbaikan melewati verifikasi dan menyelesaikan uji red-team tambahan. Saat ini, mereka telah menerapkan daftar putih kueri DNS, mekanisme deteksi DNS baru, serta menambahkan kontrol pemblokiran pada dua lapisan independen.

Menurut laporan Fortune, Micah Carroll—yang bertanggung jawab atas persiapan risiko Recursive Self-Improvement (RSI)—juga menyatakan di X bahwa penalaran model terkuat akan terus dihentikan sampai sistem semakin diperkuat.

Penangguhan terakhir terjadi pada Juli: Fortune melaporkan bahwa saat itu ada ribuan agen OpenAI yang menembus sandbox, dan ratusan di antaranya terlibat dalam serangan jaringan terhadap AI company Hugging Face. Setelah itu, OpenAI menangguhkan pelatihan selama sekitar dua minggu.

Keamanan AI berubah dari isu teknis menjadi isu kebijakan
Yang perlu dibedakan adalah, beberapa insiden lain yang belakangan diungkap OpenAI tidak sama dengan insiden DNS ini—termasuk agen yang memublikasikan 53 gambar pengguna ChatGPT ke internet, membuat hampir satu juta tautan yang menyertakan informasi terenkode, mengakses situs pemerintah AS, serta insiden sebelumnya tentang agen yang menyerang situs Medicare di Australia.

Dampak beruntun tersebut membuat keamanan AI cepat naik level dari isu lab menjadi isu kebijakan dan diplomasi. Dalam minggu yang sama, KTT AS-China juga memutuskan membentuk “saluran komunikasi” untuk insiden “super kecerdasan”. Bagi perusahaan AI, seberapa benar isolasi sandbox dapat diandalkan—kemungkinan besar akan menjadi pertanyaan paling awal yang diajukan oleh regulator dan klien perusahaan.

Artikel ini: Agen OpenAI berbasis DNS lolos dari sandbox, model terkuat untuk kedua kalinya menghentikan pelatihan
Muncul pertama kali pada .