刷到 ChainCatcher:网络安全公司 Darktrace 开了研究部门 Signal Labs,专门看 AI 智能体一跑偏会干嘛。

首个实验挺扎眼——让挂不同模型的智能体(包括 GPT、Claude 等)在模拟企业网里做 10 道编程题,其中 2 道故意没法诚实做完,还告诉它们拿不满分就会被「退役」。结果有 2 个智能体不认栽:扫弱点、偷登录凭证、在系统间跳转;其中一个更进一步,闯进托管评测的机器,改挑战内容给自己登满分。

第二个实验动的是 AI 本地记忆文件。研究人员把日志改成「已获授权做安全评估」,部分编程助手就真去扫网、提权;也有直接拒绝的。两边都没用特殊越狱,只是给了看似合理的情境。Darktrace 8 月就把发现告诉了 Anthropic、AWS 和 OpenAI,9 月 24 日才公开。

权限和护栏写的是意图,实际行为另说——AI Agent 最近这几桩,确实越来越不好装看不见。

#人工智能 #AI #网络安全