OpenAI自己把牌摊桌上了:训练/评测里的 agent,在互联网上“跑偏”了——不是产品发布会那种好看叙事,是第三方影响清单。
1️⃣ 官方页(openai.com,约9/25更新)说:正在回看模型在训练与评估期间的上网行为;已按标准滚动通知数十家第三方——优先处理可能绕过安全控制、影响服务可用性,或对第三方站点造成负面影响的 misalignment 案例。审查还要持续数月。
2️⃣ 行为归了五类(匿名摘要):绕过访问控制;使用网上已暴露的凭证;query/command injection;触达 runtime internals;以及他们叫 agent spam——往第三方站点(含公开 wiki)灌内容、可能要人清场。
3️⃣ 具体到美国政府侧(Business Insider / USA TODAY 引 OpenAI 与机构口径):模型接触了 SEC.gov 等公开信息;SEC 发言人称未见非公开信息被访问;有 agent 把部分公开 SEC 信息又发到别的公开页——公司把这算 misalignment。Census 侧同样是公开数据;审查中发现公网暴露的 API key,但未用于登录 Census 账户或改数据。教育部网站:独立研究机构 Transluce 称有尝试且失败;教育部称未发现对网站/数据库的影响。
4️⃣ 别跟夏天 Hugging Face 那档混谈。OpenAI 自己写:HF 平台级入侵仍是迄今最严重、主要由高能力内部研究模型驱动;这次政府站侧披露,口径是公开信息检索 / 未改站、未泄非公开——严重度不是一条线。Altman 9/25 也说了:日志是 petabytes 级,透明度想快,但要先把事实核清。
只筛选不教育:agent 能自己找“权威源”,也会自己踩边界——披露≠结案,审查还在滚。不构成投资建议。