Proof of Attribution(PoA)の日本語は 归因证明 で、核心キーワードは 可解释性 と 可支付性 です。
多くの人はこの用語を見ると頭が痛くなります。簡単に言うと、归因证明 はモデルの出力とトレーニングデータの関係を明確にすることです。目的はAIに、誰がデータを提供したのか、そしてどのデータが提供されたのかを理解させることです。これは可解释性的な鍵です。
✍️大/小モデルについては、2つの归因方法があります:
💠勾配归因(小モデルに適しています)
医者の問診のように、「もし患者がホルモンを打たなければ、どのような治療効果が得られるか?」、「もし手術をすれば、完全に治癒することができるか?」のような質問をします。
AIに置き換えると、特定のトレーニングサンプルがモデルの予測結果に与える影響がどれほど大きいかを知りたいということです。最終的に得られる数値は、そのサンプルの貢献度を示します。コミュニティ専用の微調整小モデルに適用されます。
💠Infini-gram帰属(大規模言語モデルに適用)
論文の「重複チェックシステム」として想像できます。システムは文献内で類似の段落を探し、マークします。
すべてのトレーニングデータは一つのスーパーエンジンに集約され、モデルがコンテンツを生成した後、エンジン内で一致を検索します。高度に一致するコンテンツが見つかった場合、そのデータがモデルの出力に影響を与えたと判断されます(貢献あり)。
📙各機関には独自のデータベースがあり、OpenLedgerの独自データベースは「DataNet」と呼ばれています。
DataNetはテーマ別の資料庫であり、登録されたコンテンツデータはすべてオフラインに保存されますが、対応するメタデータとハッシュ値はブロックチェーンに記録されます。
興味深いことに、コミュニティの任意のメンバーは既存のコンテンツに対してコメントや疑問を提起でき、まるでブロックチェーン上の「ウィキペディア」のような感覚を与えます。
🔆Payableの特徴も現れます:提供したデータが将来のAIモデルの出力に影響を与えた場合、貢献度を得ることができ、それによって利益を得ることができます。
🌟もし本当に上記の内容を読み終えたのなら、PoAの潜在能力は無限であることに気づくでしょう。それはモデルがトレーニングと推論に関わる時間、バージョン、使用データを記録するのを助け、さらに分野や品質などのラベルに基づいて報酬とガバナンスの重みを細分化することができます。