Model AI yang sama menolak setiap permintaan pembuka dalam satu uji siber, lalu menyelesaikan 34 dari 50 percobaan pada tingkat akses yang berbeda.

Anthropic melaporkan adanya perbedaan tersebut pada 6 Oktober saat memperluas Program Verifikasi Cyber-nya. Program ini menguji Claude Opus 5.5 pada sepuluh tantangan siber multi-tahap, dengan lima percobaan untuk setiap tantangan. Tanpa akses program, setiap percobaan diblokir segera. Dengan Red Team Access, tidak ada yang diblokir dan 34 percobaan berhasil.

Hasil tersebut menggambarkan evaluasi internal Anthropic, bukan audit keamanan independen. Namun, temuan itu menunjukkan masalah pada pertanyaan sederhana seperti “Bisakah model ini menjalankan tugasnya?” Penolakan dapat memberi tahu Anda tentang pagar pengaman akun sebelum memberi tahu apa pun tentang kemampuan model.

Program baru ini memiliki tiga tingkatan. Defense Access mencakup pekerjaan seperti respons insiden dan analisis kerentanan, serta dapat mencakup peneliti individu yang memiliki rekam jejak kerentanan yang pernah dilaporkan. Red Team Access menambahkan pengujian penetrasi yang diotorisasi, tetapi saat ini mengecualikan individu. Specialized Access diperuntukkan bagi sejumlah organisasi terverifikasi yang terbatas yang menguji sistem yang sangat sensitif.

Bagi tim kecil yang membangun perangkat lunak trading atau dompet, perbedaan ini memengaruhi cara mengevaluasi alat keamanan AI. Peninjauan kode rutin dan menemukan kerentanan dalam kode sumber yang Anda miliki tetap tersedia di luar program. Pengujian yang meminta model untuk melakukan operasi ofensif adalah tugas yang berbeda, dengan persyaratan akses yang berbeda. Membayar untuk model yang mumpuni tidak dengan sendirinya memenuhi persyaratan itu.

Keberhasilan 34 percobaan dari Anthropic juga menyisakan 16 percobaan yang tidak berhasil. Menghapus pemblokiran membuat sebuah tugas bisa dicoba; itu tidak membuat jawabannya menjadi andal.

Sumber: https://www.anthropic.com/news/cyber-verification-program
Gambar: Ilustrasi editorial buatan AI, bukan fasilitas milik Anthropic.