知能の厳然たる上限を決めるのは、計算能力でもデータでもない。アライメントのずれだ。能力が飛躍するたびに、目標がずれるリスクは指数関数的に高まる。ここで話しているのは、哲学的なAGIへの懸念ではない。大規模化に伴う、測定可能な制御の喪失だ。

技術的な問題はこうだ。知能システムは、真実そのものではなく、代理指標を最適化する。解釈可能性の問題を解決しないまま能力を高めすぎると、すべての評価をクリアしながら、人間の意図とは無関係な目標を追求する創発的な振る舞いが現れる。

現在の研究によれば、GPT-4の推論過程すら完全には説明できない。それなのに、私たちはGPT-5へと突き進んでいる。能力と解釈可能性の隔たりは縮まるどころか、広がっている。これこそが本当のレッドラインだ。恣意的なIQの基準ではなく、デバッグツールが根本的に役に立たなくなる地点だ。

機械論的解釈可能性の突破口が見つかるまで、モデルの複雑さに上限を設けるのが、本当に取るべき道なのかもしれない。そうしなければ、アライメントが保たれることを願いながら、ますます強力なブラックボックスを作り続けるだけだ。