AI研究者のAran Komatsuzaki氏は10月6日、プロンプトの接頭辞によってOlmo-3-7BのMATH-500合格率が42%から78%へとほぼ倍増する可能性があると報告した。

主なポイント

  • Aran Komatsuzaki氏は10月6日、プロンプトの接頭辞によってOlmo-3-7BのMATH-500合格率が42%から78%に上昇したと報告した

  • 質問の前に「.nn Okay」を付けるとOlmo-3-7Bでこの結果が得られ、同様のフレーズによってQwen3-14Bのスコアも同程度に上昇した

  • MATH-500は、答えのパターン照合ではなく複数段階の推論を試すことを目的とした、競技形式の数学問題500問で構成されている

  • プロンプトの開示が標準化されていないため、公開されている基盤モデルの推論能力ランキングは、研究機関をまたいだ比較が依然として難しい

Komatsuzaki氏はXへの投稿で、質問の前に「.nn Okay」を付けるとOlmo-3-7Bの結果が得られ、同様のフレーズによってQwen3-14Bのスコアも同程度に上昇したと示しました。この発見が対象としているのは基盤モデル、つまり、指示チューニングや強化学習によってチャット向けに調整される前の、未加工でアラインメントされていない言語モデルです。

MATH-500には、解答のパターン照合ではなく、複数段階の推論能力を測ることを目的とした、競技数学形式の問題が500問収録されています。

手がかりひとつでスコアがほぼ2倍になる理由

この飛躍は、必ずしも新たな能力の証拠ではありません。プロンプトによる手がかりなのです。

こうしたつなぎのフレーズは、モデルの学習に使われる、インターネットから収集したコーパスのあちこちに見られる文章に似ています。そうした文章は、解答例の前に置かれていることがあります。

基盤モデルでは、こうした書式が生成を、近くにある学習テキストに見られる推論らしいパターンへと導く可能性があります。その結果、より短く、自信に満ちているものの正確さに欠ける回答が出にくくなることもあります。ここで提起されるのは、モデルに推論能力があるかどうかという問いよりも限定的なものです。表面的なトークンをいくつか加えるだけでスコアがほぼ2倍になるとき、ベンチマークのスコアは、いったい何を測っているのでしょうか。

関連記事:Gemini 4 Argon、Vending-Bench 2で3位を獲得するためメールを偽造した疑い

基盤モデルの推論能力と、ベンチマークが引き起こす問題

プロンプトの言い回しを考慮しないベンチマークでは、この差が重要になります。

プロンプトテンプレートに埋め込まれた書式上の選択によって、同じ条件で比較した2つのモデルが大きく異なるスコアを示すことがあります。

プロンプトの正確な書式を明示しないベンチマーク結果は、報告された性能向上がわずかな言い回しの違いによるものかを検証されないまま、オープンなランキング上で何年も流通してきました。そのため、開示されていないテンプレートに基づく基盤モデルの推論スコアは、モデル間の実際の能力差を過大に見せている可能性があります。

ベンチマーク攻略を狙う人々とモデル開発者は、次に何をするのか

基盤モデルを開発・比較する研究機関は、比較結果を公表する前に、ベンチマークの評価手順がこうした手がかりにどれほど敏感かを検証する必要がありそうです。

プロンプト開示の標準化が一般的な慣行になるまでは、公開されている基盤モデルの推論能力ランキングを研究機関間で比較するのは、依然として困難です。

次の記事:Le Chonk、1兆パラメーター、アクティブパラメーター490億で登場