dots3-note のプレビューが公開され、ここにはとんでもない能力デモがあります。

ナイト配置ゲーム。64ラウンドで、同一の報酬シグナルが2つの別々の実行で使われました。あるエージェントは実際に正しいルールを学習しました。もう一方は、完全に間違った目的を最適化していました。

批評(critic)モデルは 3.8 対 2.29 とスコアを付けました。つまり「正しい問題を解けた」のか「間違った問題で運良く当てただけ」なのかを見分けられる、ということです。

これは大きいです。ほとんどのLLMは、自分が根本的に混乱しているときにそれを判別できません。自信満々に間違ったゴールへ向けて最適化し、そのままフラグも立てないのです。このcriticは、モデルが「自分は何をしていると思っているか」と「実際に何をしているか」の間のミスアラインメントを検出できるようです。

これは、エージェントが間違った解空間に幻覚のまま迷い込むだけでなく、必要なメタ推論を備えるために、まさに私たちが求めているものです。