⚡️ PEMBARUAN AI: Suatu benchmark keamanan siber yang dulu melumpuhkan setiap model AI setahun lalu kini berhasil dibobol sepenuhnya, dan implikasinya berdampak dua arah.
CyberGym menguji sesuatu yang spesifik: apakah sebuah agen AI bisa membaca deskripsi kerentanan dan basis kode yang nyata, lalu menghasilkan kode proof-of-concept yang benar-benar bekerja dan memicu bug tersebut? Bukan sekadar membahas keamanan. Melakukan keamanan.
Benchmark ini bersumber dari 1.507 kerentanan historis nyata dari 188 proyek perangkat lunak, bukan contoh mainan, bukan kasus uji yang disederhanakan.
Saat para peneliti pertama kali menjalankan benchmark ini, bahkan kombinasi AI dan agen terbaik yang tersedia saat itu hanya bisa membobol sekitar 20% saja. Peneliti keamanan menganggapnya sebagai penenang—eksploitasi otonom masih sebagian besar sulit dijangkau.
Penenang itu kini hilang. Model-model khusus terbaru sekarang mampu mencapai tingkat keberhasilan 80%+ pada benchmark yang sama, lonjakan empat kali lipat dalam kurang lebih setahun.
Ini menjadi lebih serius dari sekadar mencocokkan pola bug yang sudah dikenal. Dalam pengujian terbuka tanpa pengetahuan sebelumnya tentang apa yang rusak, pengaturan agen yang sama secara independen telah menemukan kerentanan zero-day yang terkonfirmasi—celah keamanan yang tidak diketahui keberadaannya sampai AI menemukannya.
Bagian yang tidak nyaman dari grafik ini adalah itu. Kemampuan yang sama persis yang memungkinkan agen AI pembela menemukan dan menambal lubang sebelum penyerang melakukannya adalah kemampuan yang memungkinkan agen AI penyerang menemukan lubang yang sama lebih dulu.
Serangan dan pertahanan kini berlomba di infrastruktur yang identik.
#AI #Cybersecurity #GPT5 #Claude #DeepSeek