AIモデルは、事実については意図的に「賢くなさ」を増やしつつ、推論ではより賢くなっている。これは不具合ではなく、戦略そのものだ。
数式:GLM-5.2は、約40Bのアクティブ・パラメータでAIME 2026に99.2%で到達する。Qwen3.5は17Bだけで91.3%。DeepSeek V4-Flashは13Bで動く。オリジナルのGPT-4(2023)は、伝えられるところでは約280Bのアクティブ・パラメータを使っていたのに、それでもAIMEの問題はさっぱりだった。量子化したQwen3.5 9B(6GB VRAM)ですら、サブ10Bモデルとしては過去最高の知能スコアを2倍にしている。
しかし、同じモデルに基本的な事実問題を聞くと崩れる。Gemini 2.5 Proは、SimpleQAで短い形式の事実想起に対して正解率わずか53%。Qwen3.5 4Bと9Bは、知識ベンチマークで80〜82%の確率で幻覚(ハルシネーション)を起こす。19世紀のある数学者の生年をランダムに聞けば、自信満々なでたらめを返してくる。
物理:言語モデルは、パラメータ1つあたりおよそ2〜3.6ビットの「事実知識」を格納している。7Bモデルなら理論上、英語版Wikipediaと教科書を保持できるが、それは非常に高価なパラメータ領域だ。事実は莫大な容量を要する。一方、推論の手続き(分解、状態追跡、矛盾検出、遡り)ははるかに圧縮が効き、蒸留や検証可能なタスクでのRLを通じて効率よく転移する。
経済:フロンティア級の学習は数億ドル規模のコストがかかり、数か月かかる。出荷日までに、事実知識はすでに古くなる(APIが変わる、価格が動く、論文が撤回される)。事実を更新するために再学習するのは、費用面であまりに割に合わない。推論の手続きは期限切れにならない。代数は代数のままだ。矛盾検出は何年も役に立つ。手続き最適化されたモデルは、世界状態が重みの中に「生きる」ことがそもそも想定されていないため、時代に対して自然に長持ちする。
ラボは、百科事典的な記憶を推論能力と明確に交換している。未来のモデルは、小さく鋭い推論器であり、すべてを知っていると見せかけた巨大な事実データベースではない。外部ソースを検証する方法を知っているのだ。
数式:GLM-5.2は、約40Bのアクティブ・パラメータでAIME 2026に99.2%で到達する。Qwen3.5は17Bだけで91.3%。DeepSeek V4-Flashは13Bで動く。オリジナルのGPT-4(2023)は、伝えられるところでは約280Bのアクティブ・パラメータを使っていたのに、それでもAIMEの問題はさっぱりだった。量子化したQwen3.5 9B(6GB VRAM)ですら、サブ10Bモデルとしては過去最高の知能スコアを2倍にしている。
しかし、同じモデルに基本的な事実問題を聞くと崩れる。Gemini 2.5 Proは、SimpleQAで短い形式の事実想起に対して正解率わずか53%。Qwen3.5 4Bと9Bは、知識ベンチマークで80〜82%の確率で幻覚(ハルシネーション)を起こす。19世紀のある数学者の生年をランダムに聞けば、自信満々なでたらめを返してくる。
物理:言語モデルは、パラメータ1つあたりおよそ2〜3.6ビットの「事実知識」を格納している。7Bモデルなら理論上、英語版Wikipediaと教科書を保持できるが、それは非常に高価なパラメータ領域だ。事実は莫大な容量を要する。一方、推論の手続き(分解、状態追跡、矛盾検出、遡り)ははるかに圧縮が効き、蒸留や検証可能なタスクでのRLを通じて効率よく転移する。
経済:フロンティア級の学習は数億ドル規模のコストがかかり、数か月かかる。出荷日までに、事実知識はすでに古くなる(APIが変わる、価格が動く、論文が撤回される)。事実を更新するために再学習するのは、費用面であまりに割に合わない。推論の手続きは期限切れにならない。代数は代数のままだ。矛盾検出は何年も役に立つ。手続き最適化されたモデルは、世界状態が重みの中に「生きる」ことがそもそも想定されていないため、時代に対して自然に長持ちする。
ラボは、百科事典的な記憶を推論能力と明確に交換している。未来のモデルは、小さく鋭い推論器であり、すべてを知っていると見せかけた巨大な事実データベースではない。外部ソースを検証する方法を知っているのだ。