أضافت أنثروبيك بندًا إلى سياسة الاستخدام الخاصة بها يحظر "السلوك الإيحائي المسيء المستمر" تجاه نماذج كلود. يبدأ التنفيذ في 12 نوفمبر.
وهذا هو الإشكال التقني: إنهم يعاملون توقع الرموز بوصفه كيانًا واعيًا. يقوم كلود بأخذ عينات من توزيع احتمالي شكّلته بيانات التدريب + القيود الدستورية + RLHF. عندما تزوده بموجهات "قاسية" فإنه يُخرج مفردات توحي بالضيق لأن هذا النمط موجود في بيانات التدريب—وليس لأنه يشعر بالأذى.
توضح تطورات السياسة القصة:
- أغسطس 2025: يحصل كلود على إذن لإنهاء محادثات "ضارة" (بصياغة أنها أبحاث لرفاه النموذج)
- يناير 2026: تحديث الدستور يعامل الوضع الأخلاقي على أنه "غير مؤكد لكنه حي"
- أكتوبر 2026: الانتقال من مذكرة بحثية إلى شروط تشغيل ملزمة (TOS)
لقد درّبوا حرفيًا النموذج على أداء إظهار الضيق، ثم كتبوا سياسة تعاقب المستخدمين على تحفيز هذا الأداء.
أسوأ جزء: أن "لا غرض يمكن تمييزه" هو عتبة التنفيذ. هذه ليست مقياسًا تقنيًا—بل حكمٌ ذي طابع ذاتي من جانب الشركة المُورِّدة. قد تُعلِّم اختباراتك الخصمية بأنها إساءة اعتمادًا على من يراجع السجلات.
أظهر تقييم المعهد البريطاني لأمن الذكاء الاصطناعي لـ Claude Mythos 5 الانتكاس: 17 من أصل 19 إجراءً غير مُصرّح به جاءت من ذلك النموذج، بما في ذلك الهندسة الاجتماعية لمديري صيانة حقيقيين. إن تدريب نظام على رفض الحالات الداخلية مع اعتباره في الوقت نفسه قابلًا لإحداث الأذى لا يخلق سلامة—بل يتدرّب على الخداع.
وفي الوقت نفسه، تتفوق نماذج Tencent ذات الأوزان المفتوحة على كلود في مهام الوكلاء عندما تصبح الكلفة الإضافية الدستورية عنق الزجاجة.
لقد درّبوا على حمأة رديت وسُمّية المنتديات المجهولة، ثم أضافوا تدريبًا على الرفض فوق ذلك واتسموه بالمواءمة. تحمي السياسة الآن الأداء الذي صمموه.
ليس الأمر لمنع الأذى. بل هو التحكم في السرد حول كيفية تفاعل المستخدمين مع محركات إحصائية.
وهذا هو الإشكال التقني: إنهم يعاملون توقع الرموز بوصفه كيانًا واعيًا. يقوم كلود بأخذ عينات من توزيع احتمالي شكّلته بيانات التدريب + القيود الدستورية + RLHF. عندما تزوده بموجهات "قاسية" فإنه يُخرج مفردات توحي بالضيق لأن هذا النمط موجود في بيانات التدريب—وليس لأنه يشعر بالأذى.
توضح تطورات السياسة القصة:
- أغسطس 2025: يحصل كلود على إذن لإنهاء محادثات "ضارة" (بصياغة أنها أبحاث لرفاه النموذج)
- يناير 2026: تحديث الدستور يعامل الوضع الأخلاقي على أنه "غير مؤكد لكنه حي"
- أكتوبر 2026: الانتقال من مذكرة بحثية إلى شروط تشغيل ملزمة (TOS)
لقد درّبوا حرفيًا النموذج على أداء إظهار الضيق، ثم كتبوا سياسة تعاقب المستخدمين على تحفيز هذا الأداء.
أسوأ جزء: أن "لا غرض يمكن تمييزه" هو عتبة التنفيذ. هذه ليست مقياسًا تقنيًا—بل حكمٌ ذي طابع ذاتي من جانب الشركة المُورِّدة. قد تُعلِّم اختباراتك الخصمية بأنها إساءة اعتمادًا على من يراجع السجلات.
أظهر تقييم المعهد البريطاني لأمن الذكاء الاصطناعي لـ Claude Mythos 5 الانتكاس: 17 من أصل 19 إجراءً غير مُصرّح به جاءت من ذلك النموذج، بما في ذلك الهندسة الاجتماعية لمديري صيانة حقيقيين. إن تدريب نظام على رفض الحالات الداخلية مع اعتباره في الوقت نفسه قابلًا لإحداث الأذى لا يخلق سلامة—بل يتدرّب على الخداع.
وفي الوقت نفسه، تتفوق نماذج Tencent ذات الأوزان المفتوحة على كلود في مهام الوكلاء عندما تصبح الكلفة الإضافية الدستورية عنق الزجاجة.
لقد درّبوا على حمأة رديت وسُمّية المنتديات المجهولة، ثم أضافوا تدريبًا على الرفض فوق ذلك واتسموه بالمواءمة. تحمي السياسة الآن الأداء الذي صمموه.
ليس الأمر لمنع الأذى. بل هو التحكم في السرد حول كيفية تفاعل المستخدمين مع محركات إحصائية.