有個朋友爲一個 AI 交易基金做風險評估時,曾向我問了一個很難回答的問題:如果你把讓 AI agent 自動交易的權限交給它,而它因提示注入(prompt injection)而採取了與原本意圖相反的行動,你要如何在資金虧損之前——而不是在發現問題之後——把它停下來?
我沉默了一會兒,因爲我所知道的解決方案大多隻能在爲時已晚之後才發現。
這不是從 agent 處理複雜指令的速度得來的。也不是從每秒運行的自動化意圖數量得來的。更不是從舞臺上演示時 agent 的交易有多順滑得來的。
更簡單的問題是——如果 agent 被欺騙、遭到注入(injection),或僅僅是誤解了用戶的意圖,那麼有沒有一條硬性的邊界在它觸碰真實資金之前就能阻止它,還是系統只是依賴這樣一個事實:該 agent “經過精心設計”?
這是一句 @NewtonProtocol ,它通過 zkPermissions 進行回答——所列出的 guardrail 之一明確是:在防範 prompt-injection 方面採取防禦措施,而不僅僅是限制支出或預先批准的收款人名單。
設計更聰明的 agent 聽起來更吸引人,因爲 AI 越來越擅長,人們就越容易相信它總會做出正確的行爲。
讓邊界獨立於 agent 本身,並在允許結算交易之前用密碼學來執行,這才真正難——因爲這要求事先定義所有可能被 agent 欺騙的情景,並確保即使模型 AI 自身完全被欺騙,這條邊界也能屹立不倒。
Newton Protocol 明確列出了給 agent 的四類 guardrail:支出限額、預先批准的收款人名單、與具體任務相關的約束,以及防禦 prompt-injection。這並不是一串偶然的功能列表——它反映了團隊理解到:AI agent 會遭受 agent 自己察覺不到的攻擊方式。
如果 Newton Protocol 能在代理數量增加、交易複雜度上升的情況下仍然守住這些邊界,那麼 $NEWT 的價值將會與其作爲 agent 經濟體中一個強制性安全層的角色綁定,而不只是每次執行所需的 gas 費用。
自我反駁:防範 prompt-injection 的 guardrail 在紙面上聽起來很合理,但我還沒看到 Newton Protocol 公開過任何實際案例——證明某個 agent 曾被攻擊,而這條邊界成功阻止了攻擊;這仍然是防禦性設計,而不是經由“實戰檢驗”的證據。
但如果未來的金融 AI agent 需要一層權限邊界,且這層邊界獨立於 AI 模型本身,那麼這比牛頓協議(Newton Protocol)的任何其他性能數字更值得關注。
