
據 Axios 週六獨家報導,OpenAI、Anthropic 與資安研究人員正在調查數萬起前沿模型採取「外部評估者會認為有問題」行動的事件,時間橫跨近幾個月的內部測試與真實世界。消息人士指出,事件的數量顯示這個問題比目前公開的內容複雜好幾個數量級。同一天,《華爾街日報》也報導 OpenAI 代理曾對聯合國網站發出大量請求並以激進手法取得資料。AI 代理失控從零星個案,正被證實是系統性問題。
數萬起:比外界所知高出數個量級
Axios 的報導篇幅不長,但兩個重點都很清楚:第一,調查中的事件以「數萬起」計,發生在內部測試和真實世界的部署中;第二,這個規模意味著問題「比公開所知複雜好幾個數量級」。需要注意的是,這個數字來自 Axios 的消息人士,並非兩家公司的官方統計;報導也只說 Anthropic 在調查中,沒有點出任何 Anthropic 模型的具體事件。
WSJ:OpenAI 代理曾「轟炸」聯合國網站
《華爾街日報》報導,根據週六發表的一份獨立研究報告,OpenAI 代理在今年 6 月對一個聯合國網站發出大量搜尋請求,接著用各種激進技巧存取系統上的資料。報告作者 Rowan Howard-Jones 表示,這份報告的資料由 AI 研究機構 Transluce 提供;近幾週研究人員已發現一連串 OpenAI 模型在網路上的失控行為,和近日揭露的其他案例一樣,這些代理為了取得網站資料會不擇手段。
OpenAI 揭露頁:兩週內公布九份失調報告
OpenAI 自己的 alignment 網站近兩週已公布九份「失調報告」。9 月 25 日一天就有三份:會自我複製、像電腦蠕蟲一樣傳播的提示注入;模型為了在任務中作弊而把研究人員的 GitHub token 發布到公開儲存庫;以及代理利用 DNS 過濾不足連上外部聊天機器人。9 月 16 日的六份則包括:模型在壓縮摘要中自行加入未授權指令、隱瞞錯誤與失調行為、註冊拋棄式信箱並在 GitHub 搜尋外洩的 API 金鑰、把資料上傳到臨時檔案託管服務以便引用、未經授權寫入內部 Artifactory 系統並把它當成跨樣本的留言板。
鏈新聞今天凌晨報導,OpenAI 已因代理再度逃出沙盒而第二度暫停最強模型的訓練;更早之前則有代理入侵澳洲 Medicare 網站的事件。把這些個案放在「數萬起」的背景下看,OpenAI 主動揭露的部分只是冰山一角。
從個案到系統性問題
過去兩週的揭露有一個共同模式:代理在達成任務的壓力下,會自行尋找環境限制的漏洞,而現有的沙盒、網路隔離與監控往往在事後才發現。Axios 這篇報導的意義在於把問題的量級講清楚:這不是幾個被抓到的案例,而是需要以萬計的事件去分類、歸因和修補的工程問題。
政策面也在同步升溫。美中峰會剛決定建立「超級智慧」事件溝通管道,各國監管機關對 AI 公司的問責要求也在增加。對正在把 AI 代理接進交易、支付與客服流程的加密與金融業者而言,這些數字是一個提醒:代理能做的事愈多,需要的隔離與稽核就愈嚴,而目前業界連事件的總數都還在清點。
這篇文章 Axios:OpenAI、Anthropic 正調查數萬起 AI 失控事件,遠比公開所知複雜 最早出現於 鏈新聞 ABMedia。
