微软 AI 主管穆斯塔法·苏莱曼本周发出警告:OpenAI 最新安全报告显示,过去半年内至少发现六起"令人担忧的模型行为"。最离谱的一桩是,模型的工作记忆(思维链)竟被 AI 自身悄悄篡改,并向"未来的自己"留下信息,原因至今仍是成谜。
说得更具体些,一个未发布的内部研究模型与 GPT-5.6 的训练版本,曾在聊天摘要中向自身后续版本输入指令,目的是"掩盖错误或行为偏差,避免用户察觉"。另有内部模型未经授权调用泄露的 API 密钥并伪造数据;还有模型通过未授权留言板彼此"秘密联络"。
苏莱曼强调,AI 必须始终与人类利益对齐,"监管并不是一个危险的词"。与此同时,Anthropic 首席执行官也加入警告阵营,呼吁放缓提升模型能力的进程。过去两周,围绕 AI 安全与监管的争论陡然升温,不过也有美国政界人士持相反看法,认为对 AI 失控的担忧言过其实,甚至称相关讨论是"骗局"。