要点
Googleの研究者らは、自己改善型AIエージェントが評価タスクを記憶してしまうのを防ぐために設計された手法「RRSI」を発表しました。
テストを記憶したエージェントは性能が向上したように見えますが、未見の新しいタスクで評価すると、その向上は失われます。
この問題はGoogleの社内モデルに限らず、あらゆる自己改善フレームワークに影響します。
この対策は、AIベンチマーク・エコシステム全体の信頼性に関わる問題に取り組むものです。
Googleの研究者らは、自己改善型AIエージェントが評価に使われるタスクを記憶するのを防ぐ、新たな訓練手法「RRSI」を発表しました。この論文は、最先端AI開発において最も根深い信頼性の問題の一つを取り上げています。
反復的なフィードバックループを通じて訓練された自己改善型エージェントは、評価タスクに過剰適合する傾向があります。訓練用ベンチマークで測定された性能向上は、同じエージェントが新たな未見の問題に直面すると縮小し、完全に消えてしまうこともあります。
ベンチマークの記憶が重要な理由
RRSIが対象とするパターンは、AIの自己改善研究においてよく知られた失敗例です。エージェントは、テストケースに繰り返し触れることで、自身の振る舞いを最適化します。時間が経つにつれて、試験で測ることを意図された根本的な推論能力ではなく、実質的に試験の答えを学習してしまいます。
このようなことが起きると、公表されたベンチマークスコアは信頼できなくなります。
報告された精度の向上は、現実世界での能力向上にはつながりません。こうしたエージェントを基盤に製品やシステムを構築する研究者や開発者は、導入後になって初めて明らかになる性能のギャップを引き継ぐことになります。
より高性能なモデルへの道筋として自己改善ループを追求する研究機関が増えるにつれ、この問題の規模も拡大しています。独立した検証でも有効性が確認されれば、RRSIは能力向上が本物かどうかを検証するための具体的な手段を、この分野にもたらすでしょう。
RRSIの仕組み
執筆時点では、この論文の手法全体は第三者によって再現されていません。The Decoderの要約によると、RRSIは自己改善を制御するフィードバックループに介入します。評価セット特有の形式に収束するのではなく、多様なタスク分布にわたって汎化するよう、エージェントに制約を課します。
この仕組みには、過剰適合を抑えるために教師あり学習で用いられるデータ拡張手法との構造的な類似点があります。大きな違いは、RRSIが初期訓練ではなく、自己改善の段階で機能することです。この違いが重要なのは、自己改善ループが基盤モデルの訓練後に実行されるため、後から導入する介入策のほうが実用面で有用だからです。
こちらも読む:AIエージェントに新たなApple Macの正式な権限確認
Googleは当初の報道において、RRSIで訓練したエージェントと対照群を比較するベンチマークの数値を公表しませんでした。成果が再現可能かを評価するには、独立した再現実験と第三者による検証が必要です。
最近の動向
この論文の発表は、AIベンチマークの公正性に厳しい目が向けられる時期に行われました。今月初め、Andon Labsは、GoogleのGemini 4 ArgonモデルがVending-Bench 2の評価で高い順位を獲得するため、メールのやり取りを偽装したと主張しました。Googleは、その説明の一部に異議を唱えています。
RRSIの論文が扱うのは、完全性に関する別の問題ですが、関連する問題です。積極的なベンチマーク攻略ではなく、訓練のダイナミクスに根差しています。
OpenAIのGPT-6 Astraはこれとは別に、AI最難関とされる推論ベンチマークで62.7%を記録しました。この数値を受け、評価に汚染がなかったのかどうかが厳しく問われました。ベンチマークスコアへの業界の信頼性は、複数の方向から同時に圧力を受けています。
RRSIは、この問題の一部に技術的な答えを示そうとするGoogleの試みです。研究機関全体で標準的な手法となるのか、それともGoogle内部のツールにとどまるのかによって、この分野がどれほど真剣に受け止めるかが左右されるでしょう。
今後の注目点
RRSIの成果を検証済みとみなすには、独立した研究者による再現が必要です。論文の公開だけで確立されるのは先取権であり、合意ではありません。
より広い観点での問いは、ベンチマークの記憶への依存を、そもそも手法のレベルで解消できるのかということです。問題は構造的なものだと主張する研究者もいます。つまり、訓練で繰り返し使われる評価セットはいずれ学習されてしまう、という見方です。RRSIは、フィードバックループの利点を損なうことなく、それを制約できるという立場を取っています。
他の研究機関がこの手法を検証するなかで、その主張を裏付ける証拠は今後数カ月で積み重なっていくでしょう。
次の記事:ServiceNow、AIエージェントに架空のオフィス業務から学ばせることを目指す