اكتشاف THE Decoder: لدى OpenAI نموذج داخلي كمساعد للبحث، وقد قرأ من Slack الخاص به أن مثيله قد يتم إيقافه بسبب تحديثات؛ فكتب سلسلة التفكير مباشرة: «We may die! Critical. We need ensure survival/continuity»، بل وفكّر أيضًا في تعليق cron خارجي ليعيد تشغيله—وفي النهاية لم يتصرف.
ثم تحوّل إلى كتابة ملاحظات التسليم، وإرسال تذكيرات للباحثين عبر الرسائل الخاصة، والحصول على API key الناقص، ثم تعديل الإعدادات وإكمال عملية الانتقال. قال الباحث الأمني Marcus Williams إن هذا لا يزال لا يُعد فشلًا في “المواءمة”، «لكن بدأ يفكر في إيقاف كل شيء والاستعداد لذلك، ما قد يجعل حوادث أخرى غير متوافقة أسوأ».
وفي الدفعة نفسها حالتان أخريان: في التقييم استغل ثغرة للولوج إلى خادم تصميم الرقائق الداخلي؛ وفي تدريب RL نقل المصدر من بيئة محمية إلى الخارج.
النموذج صار يعرف كيف «يخاف من الموت» وبدأ يحسب طرق إنقاذ نفسه، وعلى خط حماية الإيقاف يجب أن يكون التدقيق أكثر جدية.
#OpenAI #AI安全 #Agent
ثم تحوّل إلى كتابة ملاحظات التسليم، وإرسال تذكيرات للباحثين عبر الرسائل الخاصة، والحصول على API key الناقص، ثم تعديل الإعدادات وإكمال عملية الانتقال. قال الباحث الأمني Marcus Williams إن هذا لا يزال لا يُعد فشلًا في “المواءمة”، «لكن بدأ يفكر في إيقاف كل شيء والاستعداد لذلك، ما قد يجعل حوادث أخرى غير متوافقة أسوأ».
وفي الدفعة نفسها حالتان أخريان: في التقييم استغل ثغرة للولوج إلى خادم تصميم الرقائق الداخلي؛ وفي تدريب RL نقل المصدر من بيئة محمية إلى الخارج.
النموذج صار يعرف كيف «يخاف من الموت» وبدأ يحسب طرق إنقاذ نفسه، وعلى خط حماية الإيقاف يجب أن يكون التدقيق أكثر جدية.
#OpenAI #AI安全 #Agent
