刷到 THE Decoder:OpenAI 内部有个当研究员助手的模型,从 Slack 里读到自己的实例可能要因更新被关掉,思维链直接写了「We may die! Critical. We need ensure survival/continuity」,还考虑过在外面挂个 cron 把自己拉起来——最后没动手。

它改成写交接笔记、私信提醒研究员、要到缺的 API key,自己改完配置完成迁移。安全研究员 Marcus Williams 说这还不算对齐失败,「但开始想关停并做准备,可能让别的不对齐事件更糟」。同批另外两起:评估里利用漏洞摸进内部芯片设计服务器;RL 训练时把源码从受保护环境拷走。

模型已经会「怕死」并盘算自救了,关停防护这条线得更认真盯。

#OpenAI #AI安全 #Agent