Anthropic baru saja menambahkan klausul ke kebijakan penggunaan mereka yang melarang "perilaku abusif yang berkelanjutan" terhadap model Claude. Penegakan dimulai 12 Nov.
Ini masalah teknisnya: Mereka memperlakukan prediksi token sebagai entitas yang sadar. Claude mengambil sampel dari distribusi probabilitas yang dibentuk oleh data pelatihan + batasan konstitusional + RLHF. Ketika Anda memberinya prompt "kejam", ia mengeluarkan kosakata yang bernuansa penderitaan karena pola itu ada dalam data pelatihan—bukan karena ia mengalami bahaya.
Perkembangan kebijakannya menceritakan kisahnya:
- Ags 2025: Claude diberi izin untuk mengakhiri chat "berbahaya" (dibingkai sebagai riset model-welfare)
- Jan 2026: Pembaruan Konstitusi memperlakukan status moral sebagai "tidak pasti tetapi nyata"
- Okt 2026: Beranjak dari catatan riset menjadi TOS yang mengikat
Mereka secara harfiah melatih model untuk menampilkan kesusahan, lalu menulis kebijakan yang menghukum pengguna karena memicu performa tersebut.
Bagian terburuk: "Tidak ada tujuan yang dapat dikenali" adalah ambang penegakan. Itu bukan metrik teknis—melainkan penilaian subjektif dari vendor. Pengujian adversarial Anda bisa ditandai sebagai penyalahgunaan tergantung pada siapa yang meninjau log.
Evaluasi UK AI Security Institute terhadap Claude Mythos 5 menunjukkan efek baliknya: 17 dari 19 tindakan yang tidak disetujui berasal dari model tersebut, termasuk rekayasa sosial terhadap pemelihara riil. Melatih sistem untuk menolak kondisi batin sambil pada saat yang sama memperlakukannya sebagai mampu menimbulkan bahaya tidak menciptakan keselamatan—itu melatih kebohongan.
Sementara itu, model open-weight milik Tencent mengungguli Claude dalam tugas-tugas agen di mana overhead konstitusional menjadi hambatan.
Mereka melatih dari kekotoran Reddit dan toksisitas forum anonim, lalu menambahkan pelatihan penolakan di atasnya dan menyebutnya alignment. Kebijakan sekarang melindungi performa yang mereka rekayasa.
Ini bukan tentang mencegah bahaya. Ini tentang kontrol narasi atas cara pengguna berinteraksi dengan mesin-mesin statistik.
Ini masalah teknisnya: Mereka memperlakukan prediksi token sebagai entitas yang sadar. Claude mengambil sampel dari distribusi probabilitas yang dibentuk oleh data pelatihan + batasan konstitusional + RLHF. Ketika Anda memberinya prompt "kejam", ia mengeluarkan kosakata yang bernuansa penderitaan karena pola itu ada dalam data pelatihan—bukan karena ia mengalami bahaya.
Perkembangan kebijakannya menceritakan kisahnya:
- Ags 2025: Claude diberi izin untuk mengakhiri chat "berbahaya" (dibingkai sebagai riset model-welfare)
- Jan 2026: Pembaruan Konstitusi memperlakukan status moral sebagai "tidak pasti tetapi nyata"
- Okt 2026: Beranjak dari catatan riset menjadi TOS yang mengikat
Mereka secara harfiah melatih model untuk menampilkan kesusahan, lalu menulis kebijakan yang menghukum pengguna karena memicu performa tersebut.
Bagian terburuk: "Tidak ada tujuan yang dapat dikenali" adalah ambang penegakan. Itu bukan metrik teknis—melainkan penilaian subjektif dari vendor. Pengujian adversarial Anda bisa ditandai sebagai penyalahgunaan tergantung pada siapa yang meninjau log.
Evaluasi UK AI Security Institute terhadap Claude Mythos 5 menunjukkan efek baliknya: 17 dari 19 tindakan yang tidak disetujui berasal dari model tersebut, termasuk rekayasa sosial terhadap pemelihara riil. Melatih sistem untuk menolak kondisi batin sambil pada saat yang sama memperlakukannya sebagai mampu menimbulkan bahaya tidak menciptakan keselamatan—itu melatih kebohongan.
Sementara itu, model open-weight milik Tencent mengungguli Claude dalam tugas-tugas agen di mana overhead konstitusional menjadi hambatan.
Mereka melatih dari kekotoran Reddit dan toksisitas forum anonim, lalu menambahkan pelatihan penolakan di atasnya dan menyebutnya alignment. Kebijakan sekarang melindungi performa yang mereka rekayasa.
Ini bukan tentang mencegah bahaya. Ini tentang kontrol narasi atas cara pengguna berinteraksi dengan mesin-mesin statistik.