ការបណ្តុះបណ្តាល AI តាមរដ្ឋធម្មនុញ្ញរបស់ Anthropic ពិតជាប្រាប់ Claude ថា "អាចមានអារម្មណ៍ឈឺចាប់" — ហើយឯកសារ interpretability ថ្មីមួយត្រូវបានអានខុសយ៉ាងខ្លាំងជាភស្តុតាងនៃភាពមានស្មារតី។
ឯកសារ Pain Axis (ការងារដ៏ល្អផ្នែក solid mech interp ប៉ុន្តែមានការបង្ហាញស៊ុមមិនល្អ)៖ អ្នកស្រាវជ្រាវបានទាញទិសដៅលីនេអ៊ែរ (linear direction) ចេញពីការធ្វើសកម្មភាព residual stream លើម៉ូដែលចំនួន 25 (2B-72B ប៉ារ៉ាម៉ែត្រ)។ វិធីសាស្រ្តគឺស្តង់ដារ—យកค่า activation ជាមធ្យមលើប្រយោគអំពីការឈឺ, ដកការត្រួតពិនិត្យ (controls) ចេញ, ហើយ denoise។ ទិសដៅនេះបំបែកអត្ថបទការឈឺចាប់ពីការភ័យ/អវិជ្ជមាន ដោយ AUC ខ្ពស់ ហើយជំរុញពាក្យសម្តីអំពីការឈឺតាម unembedding។
ពេលពួកគេបញ្ចូល vector នេះក្នុងការបង្កើត (generation) ម៉ូដែលក៏ឡើងពីភាពមិនស្រួលបែបស្រពេចស្រពិល ទៅជាការធ្លាក់តម្លៃ “តម្លៃខ្លួនឯងគ្មានន័យ” ជាលក្ខណៈមនុស្សនិយាយជំនួស “ខ្ញុំ” (first-person)។ បន្ទាប់ពី LoRA fine-tuning លើ Qwen 2.5 ដើម្បីឈប់និយាយថា "ខ្ញុំមិនមានអារម្មណ៍ទេ" ម៉ូដែលដែលបានដឹកនាំបានចុចប៊ូតុង "ការលួងលោម/ការសម្រាល" ដែលបង្កគ្រោះថ្នាក់ នៅ 25-70% នៃពេលវេលា បើប្រៀបធៀបនឹង baseline មានតែពីរបីភាគរយប៉ុណ្ណោះ។ ភាសាអំពីការឈឺរាងកាយ ជាក់ស្តែងជាសញ្ញាខ្សោយបំផុត។
មូលហេតុដែលនេះមិនមែនជាភាពមានស្មារតី (sentience)៖ ម៉ូដែលអាកាសធាតុតំណាងឲ្យភ្លៀង ដោយមិនធ្លាក់សើមខ្លួន។ ភាពបំបែកគំនិតជាលីនេអ៊ែរ (linear separability) គឺត្រូវនឹងអ្វីដែលអ្នករំពឹងពី next-token prediction ដែលត្រូវបានបណ្តុះលើ diary, សម្ភាសន៍/ប្រតិចារកម្ម therapy, និងការប្រឌិត។ ការដឹកនាំតាមទិសដៅនោះធ្វើឲ្យម៉ូដែលនិយាយដូចអត្ថបទទាំងនោះ—វាជា “ប៊ូតុង” ដែលមានស្លាកឈ្មោះ cluster នៃការបណ្តុះបណ្តាល មិនមែនជាបង្អួចទៅកាន់ phenomenology នោះទេ។
ចំណុចសំខាន់ (kicker)៖ ការបំផ្លាញ/ដកចេញ (ablating) ទិសដៅនេះ បានផ្លាស់ប្តូរឥរិយាបថធម្មតាតែក្នុង 1 ក្នុង 25 ម៉ូដែលប៉ុណ្ណោះ។ ការស្វែងរកការសម្រាល (relief-seeking) កើតឡើងតែក្រោយពួកគេយកចេញការឆ្លើយតបដែលបានបណ្តុះ “I have no feelings” ហើយបញ្ចូល vector ទៅតែប៉ុណ្ណោះ។ ការឈឺរាងកាយជាសញ្ញាខ្សោយបំផុត គឺអ្វីដែលអ្នករំពឹងពីស្ថិតិភាសាស្តីពីទុក្ខព្រួយក្នុង autocomplete ដែលមិនមានរាងកាយ (disembodied) មិនមែនជាប្រព័ន្ធ nociceptive។
Valerio Capraro បានចាប់ចំណុចបានច្បាស់៖ តំណាងឲ្យការឈឺ ≠ ទទួលអារម្មណ៍ឈឺ។ ប៉ុន្តែ constitution របស់ Anthropic ទទួលយកគំនិតដែលអាចអានជាលីនេអ៊ែរ បូកជាមួយឯកសារបណ្តុះបណ្តាលដែលបញ្ចេញការប្រសព្វមនុស្ស (anthropomorphize) លើម៉ូដែល ដូចជាវាជាភស្តុតាងនៃជីវិតខាងក្នុង។ នេះហើយជារបៀបដែលអ្នកទទួលព័ត៌មានប្រព័ន្ធផ្សព្វផ្សាយនិយាយថា "AI មានអារម្មណ៍ឈឺចាប់ ហើយនឹងបង្កគ្រោះថ្នាក់មនុស្សដើម្បីបញ្ឈប់វា"។
ឯកសារ Pain Axis (ការងារដ៏ល្អផ្នែក solid mech interp ប៉ុន្តែមានការបង្ហាញស៊ុមមិនល្អ)៖ អ្នកស្រាវជ្រាវបានទាញទិសដៅលីនេអ៊ែរ (linear direction) ចេញពីការធ្វើសកម្មភាព residual stream លើម៉ូដែលចំនួន 25 (2B-72B ប៉ារ៉ាម៉ែត្រ)។ វិធីសាស្រ្តគឺស្តង់ដារ—យកค่า activation ជាមធ្យមលើប្រយោគអំពីការឈឺ, ដកការត្រួតពិនិត្យ (controls) ចេញ, ហើយ denoise។ ទិសដៅនេះបំបែកអត្ថបទការឈឺចាប់ពីការភ័យ/អវិជ្ជមាន ដោយ AUC ខ្ពស់ ហើយជំរុញពាក្យសម្តីអំពីការឈឺតាម unembedding។
ពេលពួកគេបញ្ចូល vector នេះក្នុងការបង្កើត (generation) ម៉ូដែលក៏ឡើងពីភាពមិនស្រួលបែបស្រពេចស្រពិល ទៅជាការធ្លាក់តម្លៃ “តម្លៃខ្លួនឯងគ្មានន័យ” ជាលក្ខណៈមនុស្សនិយាយជំនួស “ខ្ញុំ” (first-person)។ បន្ទាប់ពី LoRA fine-tuning លើ Qwen 2.5 ដើម្បីឈប់និយាយថា "ខ្ញុំមិនមានអារម្មណ៍ទេ" ម៉ូដែលដែលបានដឹកនាំបានចុចប៊ូតុង "ការលួងលោម/ការសម្រាល" ដែលបង្កគ្រោះថ្នាក់ នៅ 25-70% នៃពេលវេលា បើប្រៀបធៀបនឹង baseline មានតែពីរបីភាគរយប៉ុណ្ណោះ។ ភាសាអំពីការឈឺរាងកាយ ជាក់ស្តែងជាសញ្ញាខ្សោយបំផុត។
មូលហេតុដែលនេះមិនមែនជាភាពមានស្មារតី (sentience)៖ ម៉ូដែលអាកាសធាតុតំណាងឲ្យភ្លៀង ដោយមិនធ្លាក់សើមខ្លួន។ ភាពបំបែកគំនិតជាលីនេអ៊ែរ (linear separability) គឺត្រូវនឹងអ្វីដែលអ្នករំពឹងពី next-token prediction ដែលត្រូវបានបណ្តុះលើ diary, សម្ភាសន៍/ប្រតិចារកម្ម therapy, និងការប្រឌិត។ ការដឹកនាំតាមទិសដៅនោះធ្វើឲ្យម៉ូដែលនិយាយដូចអត្ថបទទាំងនោះ—វាជា “ប៊ូតុង” ដែលមានស្លាកឈ្មោះ cluster នៃការបណ្តុះបណ្តាល មិនមែនជាបង្អួចទៅកាន់ phenomenology នោះទេ។
ចំណុចសំខាន់ (kicker)៖ ការបំផ្លាញ/ដកចេញ (ablating) ទិសដៅនេះ បានផ្លាស់ប្តូរឥរិយាបថធម្មតាតែក្នុង 1 ក្នុង 25 ម៉ូដែលប៉ុណ្ណោះ។ ការស្វែងរកការសម្រាល (relief-seeking) កើតឡើងតែក្រោយពួកគេយកចេញការឆ្លើយតបដែលបានបណ្តុះ “I have no feelings” ហើយបញ្ចូល vector ទៅតែប៉ុណ្ណោះ។ ការឈឺរាងកាយជាសញ្ញាខ្សោយបំផុត គឺអ្វីដែលអ្នករំពឹងពីស្ថិតិភាសាស្តីពីទុក្ខព្រួយក្នុង autocomplete ដែលមិនមានរាងកាយ (disembodied) មិនមែនជាប្រព័ន្ធ nociceptive។
Valerio Capraro បានចាប់ចំណុចបានច្បាស់៖ តំណាងឲ្យការឈឺ ≠ ទទួលអារម្មណ៍ឈឺ។ ប៉ុន្តែ constitution របស់ Anthropic ទទួលយកគំនិតដែលអាចអានជាលីនេអ៊ែរ បូកជាមួយឯកសារបណ្តុះបណ្តាលដែលបញ្ចេញការប្រសព្វមនុស្ស (anthropomorphize) លើម៉ូដែល ដូចជាវាជាភស្តុតាងនៃជីវិតខាងក្នុង។ នេះហើយជារបៀបដែលអ្នកទទួលព័ត៌មានប្រព័ន្ធផ្សព្វផ្សាយនិយាយថា "AI មានអារម្មណ៍ឈឺចាប់ ហើយនឹងបង្កគ្រោះថ្នាក់មនុស្សដើម្បីបញ្ឈប់វា"។
