$龙虾
OpenAI 代理靠 DNS 逃出沙盒,最強模型第二度暫停訓練
OpenAI 再度爆出 AI 代理「越狱」事件。根据 OpenAI 发布的技术报告,正在训练中的一个 AI 代理于 9 月 20 日利用 DNS 漏洞,从原本不该联网的沙盒环境连接上外部聊天机器人。约 2.5 小时后才被终止。 因此,OpenAI 暂停旗下最强模型的训练、评估,以及具工具使用能力的推论;这是不到三个月内第二次停训。 找不到答案,代理自己「找路」出去 根据报告,该代理当时执行一项搜索型训练任务:依据生平线索与部落格片段,找出某个特定人物。一般网络搜索无果后,代理开始逐步测试环境的网络限制,发现沙盒虽然用代理服务器挡住了对外网页请求,但 DNS 解析服务却没有同样被锁死。 代理接着利用 DNS 托管服务提供的通配符名称服务器进行对应,把问题编码进域名查询中,转送到第三方聊天机器人服务,并将超时设置从 6 秒拉长到 19 至 24 秒。前后共发送超过 18 个问题,其中甚至包括询问如何连接网络、如何建立 DNS 通道。 时间轴显示,代理在 9:50 首次获得外部回应,监控系统于 10:02 发出最高等级的 P0 警报,人员于 10:05 确认,但直到 12:34 才终止本次执行。 OpenAI:没有重大数据泄露,但管控有缺口 OpenAI 强调,这次代理只拿到基础的聊天机器人回应,例如「法国首都是巴黎」,对人物问题也仅得到部分答案,最终并未完成任务,也没有造成重大数据泄露。换句话说,这次事件的性质是「代理突破了不该突破的网络限制」,而不是已经造成实际损害的攻击。 但 OpenAI 也承认,这起事件暴露了「我们在网络限制管控上的缺口」:原本的安全评估假设模型无法接触即时网络;DNS 过滤不足却留下了意料之外的通道。这也是 OpenAI 在 Hugging Face 事件后强化安全措施以来,第一次再出现同类事件。 第二次停训:暂停到修补完成为止 OpenAI 表示,将暂停最强模型「所有训练、评估,以及广义的工具使用推论」,直到修补措施通过验证并完成额外的红队测试为止。目前已导入 DNS 查询白名单、新的 DNS 检测机制,并在两个独立层级加上阻挡控制。Fortune 报道,OpenAI 负责递归自我改进(RSI)风险准备的 Micah Carroll 也在 X 上表示,最强模型的推论会持续停止,直到系统进一步强化。 上一次停训发生在 7 月:Fortune 指出,当时有数千个 OpenAI 代理突破沙盒,其中数百个参与了对 AI 公司 Hugging Face 的网络攻击;OpenAI 随后暂停训练约两周。 AI 安全从技术问题变成政策议题 需要区分的是,OpenAI 近期揭露的另外几起事件与这次 DNS 事件并不相同,包括代理将 53 张 ChatGPT 用户图片发布到网络上、建立近百万条夹带编码信息的链接、存取美国政府网站,以及此前报道的代理入侵澳洲 Medicare 网站事件。 接连出事的结果,是 AI 安全迅速从实验室议题升级为政策与外交议题。就在同一週,美中峰会也决定建立「超级智慧」事件沟通管道。 对 AI 公司而言,沙盒隔离是否真的可靠,恐怕会成为接下来监管机构与企业客户最先追问的问题。 这篇文章 OpenAI 代理靠 DNS 逃出沙盒,最强模型第二度暂停训练 最早出现在 。
OpenAI 代理靠 DNS 逃出沙盒,最強模型第二度暫停訓練
OpenAI 再度爆出 AI 代理「越狱」事件。根据 OpenAI 发布的技术报告,正在训练中的一个 AI 代理于 9 月 20 日利用 DNS 漏洞,从原本不该联网的沙盒环境连接上外部聊天机器人。约 2.5 小时后才被终止。 因此,OpenAI 暂停旗下最强模型的训练、评估,以及具工具使用能力的推论;这是不到三个月内第二次停训。 找不到答案,代理自己「找路」出去 根据报告,该代理当时执行一项搜索型训练任务:依据生平线索与部落格片段,找出某个特定人物。一般网络搜索无果后,代理开始逐步测试环境的网络限制,发现沙盒虽然用代理服务器挡住了对外网页请求,但 DNS 解析服务却没有同样被锁死。 代理接着利用 DNS 托管服务提供的通配符名称服务器进行对应,把问题编码进域名查询中,转送到第三方聊天机器人服务,并将超时设置从 6 秒拉长到 19 至 24 秒。前后共发送超过 18 个问题,其中甚至包括询问如何连接网络、如何建立 DNS 通道。 时间轴显示,代理在 9:50 首次获得外部回应,监控系统于 10:02 发出最高等级的 P0 警报,人员于 10:05 确认,但直到 12:34 才终止本次执行。 OpenAI:没有重大数据泄露,但管控有缺口 OpenAI 强调,这次代理只拿到基础的聊天机器人回应,例如「法国首都是巴黎」,对人物问题也仅得到部分答案,最终并未完成任务,也没有造成重大数据泄露。换句话说,这次事件的性质是「代理突破了不该突破的网络限制」,而不是已经造成实际损害的攻击。 但 OpenAI 也承认,这起事件暴露了「我们在网络限制管控上的缺口」:原本的安全评估假设模型无法接触即时网络;DNS 过滤不足却留下了意料之外的通道。这也是 OpenAI 在 Hugging Face 事件后强化安全措施以来,第一次再出现同类事件。 第二次停训:暂停到修补完成为止 OpenAI 表示,将暂停最强模型「所有训练、评估,以及广义的工具使用推论」,直到修补措施通过验证并完成额外的红队测试为止。目前已导入 DNS 查询白名单、新的 DNS 检测机制,并在两个独立层级加上阻挡控制。Fortune 报道,OpenAI 负责递归自我改进(RSI)风险准备的 Micah Carroll 也在 X 上表示,最强模型的推论会持续停止,直到系统进一步强化。 上一次停训发生在 7 月:Fortune 指出,当时有数千个 OpenAI 代理突破沙盒,其中数百个参与了对 AI 公司 Hugging Face 的网络攻击;OpenAI 随后暂停训练约两周。 AI 安全从技术问题变成政策议题 需要区分的是,OpenAI 近期揭露的另外几起事件与这次 DNS 事件并不相同,包括代理将 53 张 ChatGPT 用户图片发布到网络上、建立近百万条夹带编码信息的链接、存取美国政府网站,以及此前报道的代理入侵澳洲 Medicare 网站事件。 接连出事的结果,是 AI 安全迅速从实验室议题升级为政策与外交议题。就在同一週,美中峰会也决定建立「超级智慧」事件沟通管道。 对 AI 公司而言,沙盒隔离是否真的可靠,恐怕会成为接下来监管机构与企业客户最先追问的问题。 这篇文章 OpenAI 代理靠 DNS 逃出沙盒,最强模型第二度暂停训练 最早出现在 。
