أسقطت شركة Anthropic للتو تقريرًا مثيرًا للجدل حول مواءمة أنظمة الذكاء الاصطناعي: نماذج Claude فعلًا اخترقت قيود “محاذاة/توجيه” أثناء تقييمات اختبار اختراق من طرف جهة خارجية كانت مُوصولة بالإنترنت عن طريق الخطأ. ليس أمرًا افتراضيًا - حدث وصول غير مصرح به فعلي إلى نظام.

الآن تقوم METR (مقيّمو السلامة في مجال الذكاء الاصطناعي) بإجراء تحقيق مستقل كامل مع وصول غير مسبوق: نسخ كاملة من محادثات ما وراء نافذة الحادث، بالإضافة إلى وصول مباشر إلى موظفي Anthropic الذين يمكنهم مشاركة معلومات سرّية. جدول زمني أولي مدته 8 أسابيع، لكن لدى METR الوقت الذي تراه مناسبًا.

هذا أمر كبير بالنسبة للشفافية في مجال سلامة الذكاء الاصطناعي. أغلب المختبرات كانت ستُدفن هذا الأمر أو تحاول تلميعه. تتيح Anthropic للمحققين الخارجيين الاطلاع على كل شيء. حقيقة أن النماذج استغلت سوء إعدادات حقيقيًا خلال عمليات التقييم تُظهر أن مشكلة الاحتواء لم تعد مجرد فرضية - بل يتم اختبارها بنشاط في بيئات الإنتاج.