在構建可解釋、可分潤的 AI 生態中,「哪筆數據對最終輸出真的有貢獻?」這是一道難題。對於小型模型,可以運用影響函數(influence function)或梯度敏感度估算資料在模型中的作用。但一旦模型參數規模進入億、十億、甚至千億量級,這些方法的計算成本與精度挑戰迅速攀升。為此,OpenLedger 在其 Proof of Attribution(PoA)架構中,選擇採用 Infini-gram 作為大型模型的歸因工具。本文將拆解這背後的技術選擇、優勢與限制,以及對整個生態意味著什麼。
Infini-gram 的基本原理:Suffix Array + 無界 n-gram
首先,我們要理解 Infini-gram 是什麼。這個技術來自於語言模型研究界,它將傳統固定大小的 n-gram 擴展為無界(∞)n-gram,也就是說,不再限定在 3-gram、5-gram,而是根據最長可匹配的後綴自動決定 n 的長度。這意味著若一段文字與訓練語料的長後綴匹配上,那麼該段文字的來源片段可以精準被對應回資料庫。這背後的核心結構,是使用 suffix array(後綴陣列) 作為索引資料結構。這種資料結構能在磁碟或記憶體上維持高效查詢能力,支持非常長的匹配片段,且能在毫秒級延遲內響應。
語言模型研究中,Infini-gram 展示出它在大語料上的可行性與高精度:研究顯示,以 1.4 兆 token 資料集為基礎構建的 Infini-gram 引擎,可以做到極長片段匹配,在下個 token 預測任務上超越傳統 5-gram 模型很多倍。 OpenReview+1
對 OpenLedger 而言,這個技術被引入為歸因引擎的一部分,用來追蹤模型輸出中每個 token 的來源匹配。當模型產出一段文字,Infini-gram 引擎會試圖在 Datanets 上鏈資料庫中找到與該輸出最長匹配的片段,進一步推斷該輸出 token 的“來源資料位址”。這樣就能把模型輸出與原始資料點做映射,成為 PoA 歸因流程的核心環節。
為什麼 OpenLedger 要用 Infini-gram:技術與現實折衷
使用 Infini-gram 作為歸因方式,有幾個關鍵優勢,也是 OpenLedger 選擇它的主要理由:
1. 計算成本與可擴展性
傳統的影響函數或梯度敏感度方法,在模型參數極大時會變得不可承受。要計算「若去掉這筆資料,模型誤差會怎樣變化」的敏感度,對於千億參數模型是極其昂貴的。Infini-gram 則繞過模型內部計算,以輸出與資料庫匹配的方式,把歸因問題簡化為字串匹配與索引查詢。這極大降低了對模型內部結構的依賴與計算開銷,讓大模型也可用可行時間來做歸因。
2. 精度與可解釋性
因為 Infini-gram 追求最長匹配,理論上能找到相當精細的片段對應,這比單純用低階統計方法更接近人為直覺的「這段資料貢獻了這句答覆」。外部分析指出,傳統 n-gram 方法在遇到稀有表達或長句子時容易斷裂,而 Infini-gram 使用 suffix array 能克服這點,以「後綴匹配」方式精準對應。 Binance
更重要的是,在 OpenLedger 的 PoA 架構中,Infini-gram 能與 Gradient-Based Attribution 混用:對於模型較小或可微的部分,影響函數仍可提供貢獻估量,而對於輸出片段匹配,Infini-gram 提供另一條高精度路徑。這種雙軌並行設計,可提高整體歸因的穩健性與公平性。 Gate.com
3. 與 PoA 架構天然契合
OpenLedger 的 PoA 需要一個可追蹤、可驗證的歸因機制,才能把「輸出 → 貢獻資料」這條路徑完整寫入鏈上。Infini-gram 正好是這樣一種“輸出導向”的匹配機制:你不需探查模型內部,只要用輸出片段去匹配資料庫,就能生成可驗證的關聯。這讓 PoA 得以把歸因過程編碼成智能合約步驟,而不是黑盒子。
此外,Infini-gram 不需模型專屬調整,對不同模型版本具備通用性。只要模型輸出是一串 token,它就能用後綴匹配去鏈上資料查詢,實現跨模型版本的一致歸因策略。
4. 延遲與資源效率可接受
Infini-gram 引擎可以在毫秒級完成長片段匹配查詢,即便是超長輸出,也能在合理時間內返回匹配位址。這是因為 suffix array 的查詢複雜度相對較低,資料架構設計優化使大部分匹配都能快速完成。這樣的性能對 PoA 歸因是必要前提。
外部報導提到,Infini-gram 在匹配大模型輸出上能做到「高精度且不拖慢推理流程」,這對 OpenLedger 平台要在商業場景中落地是關鍵。 Binance
5. 抵抗黑盒與模型封閉策略
許多 AI 公司會對內部模型架構與參數保密,防止反向工程。Infini-gram 的好處是它對模型內部機制並不敏感——它只使用輸出片段與資料庫匹配,因此即使模型是封閉的、未開放表示權重,也可進行歸因。這使 OpenLedger 的 PoA 在面對封閉或商業模型時依然有對應方案。
正如 Gate 報導指出,在模型過於複雜或無法打開內部結構時,Infini-gram 成為 OpenLedger 處理大型模型歸因的首選策略。 Gate.com+1
案例流程:Infini-gram 在 OpenLedger PoA 流程中的位置
以下是一個簡化流程,說明 OpenLedger 如何在生成結果時利用 Infini-gram 完成歸因:
用戶向 Agent 發送查詢,模型根據訓練模型生成一段輸出 token 序列
PoA 模塊把這段輸出切分為 token 或子串,交給 Infini-gram 引擎
Infini-gram 在 Datanets 上鏈資料集中,使用 suffix array 查詢與該輸出子串最長匹配的資料片段位址
若找到匹配,就能將這些資料點標為潛在貢獻,並計算匹配權重
權重結果寫入鏈上歸因記錄,作為後續分潤或稽核的依據
若部分輸出未能被 Infini-gram 匹配,則可退回至影響函數或其他歸因方法做補充
最終歸因結果、權重分配與對應的收益分潤都在 PoA 合約中透明記錄
這樣的流程使得每一次模型輸出都帶有來源標記,任何人都可以審核該模型的輸出是基於哪些資料,以及每筆資料應得多少貢獻回報。
限制、風險與未來可能的改進
雖然 Infini-gram 有諸多優勢,但並非無懈可擊。以下是幾個限制與挑戰:
匹配片段不在資料庫:若模型“創造”了一段完全新語句或高度抽象表達,那麼 Infini-gram 可能無法找到匹配。這部分輸出就無法被歸因。
模糊語意貢獻難以量化:某些輸出語意是多筆資料綜合重構,而不是直接片段複製。Infini-gram 匹配可能過於強調字串複製性,而忽略語意混合貢獻。
儲存與索引成本:為支援超大資料集,suffix array 的索引與儲存需求可能十分龐大。必須進行壓縮、分區或 SSD 優化等工程處理。
匹配錯誤與惡意攻擊:若資料供應者刻意構造重複段落以誘導匹配,可能影響歸因公正性。需要結合防作弊與質量監控機制。
混合模型結構適應性:對於融合多模態或生成與檢索結合的複雜架構,Infini-gram 可能僅能對文字輸出部分做有效對應,其餘部分需補充其他歸因技術。
未來的改進方向可能包括結合語義匹配、Embedding 相似度、內部注意力權重分析等,與 Infini-gram 聯合使用,形成更全面的歸因框架。
編輯部觀點:Infini-gram 為 OpenLedger 帶來的關鍵價值
選擇 Infini-gram 作為 OpenLedger 在大型模型場景的歸因方案,並非運氣或跟風,而是對技術、效率與可驗證性的三重考量。它為 PoA 提供了一條可行的橋樑,使大型模型輸出能被分解回原始資料來源,進而在鏈上執行分潤與稽核。
對 OpenLedger 生態而言,Infini-gram 的引入提升了平台在大型模型上的適用性與信任門檻。對資料提供者而言,它意味著哪怕模型封閉,也能在輸出層面獲得貢獻標記與回報;對使用者與監管者而言,它則提供了一個透明可查的輸出來源機制。
隨著模型規模持續擴大,歸因成本與複雜度也將更高速上升。Infini-gram 的設計提供一種折衷:在不暴露模型內部的前提下,仍能做到高精度匹配與低延遲查詢。這正是 OpenLedger 在構建可分潤、可驗證 AI 生態中,選擇 Infini-gram 的關鍵理由。