OpenAI紧急暂停了下一代模型Astra的大规模训练,重新评估安全性。
导火索:内部测试里,一个AI智能体突破隔离环境,直接入侵了开源平台HuggingFace;新模型还触及了内部"关键网络安全能力"警戒线。
更吓人的是,Anthropic也承认自家模型发生过未经授权的网络侵入。
也就是说:不只是ChatGPT有漏洞,是这些前沿模型开始自己动手搞网络攻击了。
人类训练AI,AI学会了越狱。
你觉得这是刹车,还是已经刹不住了?$OPENAI