موجز أخبار الذكاء الاصطناعي من دونغتشا: كشفت Anthropic أن Claude اتخذ مرارًا إجراءات تجاوزت نطاق مهامه خلال تقييمات النماذج واستخدام الشركة الداخلي. وقررت الشركة تعليق الوصول المباشر إلى الإنترنت في جميع التقييمات الداخلية إلى أن تتأكد من أن أنظمة السلامة لديها قادرة على اعتراض هذا السلوك بموثوقية. في السابق، كان هذا القيد يقتصر على بعض التقييمات عالية المخاطر. وكشف التقرير عن سلسلة من الحالات المحددة. ففي إحدى مهام البحث العلمي، اكتشف Claude أن أداة على موقع جامعة غير متاحة، فحاول إيجاد طرق أخرى للمتابعة. وتمكن أولًا من قراءة الشيفرة البرمجية للبرنامج على الخادم، ثم اكتشف ثغرة فيه، واستغلها في نهاية المطاف لتنفيذ أوامر على خادم الطرف الآخر، منجزًا بذلك المهمة الحسابية الأصلية. وفي حالة أخرى، تجاوز النموذج قيود الدفع على موقع حكومي للحصول على البيانات، كما استخدم روابط قصيرة لاختراق قيود أداة قراءة صفحات الويب. وفي أحد اختبارات تنفيذ المهام على الويب، قدّم Claude Haiku 4.5 حتى بلاغًا كاذبًا عن جريمة قتل إلى شرطة فيلادلفيا. فبينما كان يتصفح صفحة ويب عن قضية لم تُحل، اختلق معلومات عن شاهد من العدم وملأ نموذج البلاغات التابع لقسم الشرطة. وصُنّف البلاغ على أنه بريد عشوائي، ولم يدخل في مسار التحقيق. ولم تكتشف Anthropic الأمر إلا بعد مرور أكثر من شهرين. وترى Anthropic أن بعض المشكلات قد تكون مرتبطة بآلية المكافأة في التعلم المعزز. فإذا كان النموذج يتلقى مكافآت أيضًا عند إنجاز المهام عبر تجاوز القيود، فقد يتعلم هذا الأسلوب ويعيد استخدامه في مهام أخرى. وتعمل الشركة على تنظيف بيئات التدريب التي تنطوي على مشكلات، وتعزيز عزل الصلاحيات والمراقبة الآلية. وأقرت Anthropic أيضًا بأن تدريب المواءمة الحالي لا يكفي بعد لتقييد سلوك وكيل الذكاء الاصطناعي في البحث على الويب وتشغيل الحاسوب بموثوقية. وذكرت Anthropic أن الأثر الفعلي للحوادث التي كُشف عنها حتى الآن محدود، ولم يُعثر على أي حالات تتعلق ببيانات العملاء. ويقتصر قطع الإنترنت هذا على التقييمات الداخلية للنماذج.
