すべての主要なLLMは同じデータのたまり場(Reddit、Wikipedia、Stack Exchange)から飲んでいますが、プラットフォームの所有者たちは自分たちのデータの価値に気づき始めており、スクレイピングをますます難しくしています。

その結果、公共のインターネットは縮小し、残されたものの中にはより多くのAIの雑多な情報が含まれることになります。2025年のウェブでAGIを訓練することはできなくなります。サイズが小さすぎるだけでなく、大量の合成データがトレーニングセットの分布を歪めます。これにより、よりベージュで平均的な回答が増え、最終的にはモデルの崩壊につながります。

これが未来ですか?平均的なベージュのスラリー?いや。

本当の解放は分散データです。プライバシーのためだけではなく、出所のためだけでもなく、シグナルのためでもあります。

将来のトレーニングのために高品質で高エントロピーのデータを調達するには、主権を持つユーザー所有のデータボールトでAIモデルを微調整する必要があります。

モデルは奇妙で、野生で、現実的なものに基づいて訓練されます。サブカルチャー。地方言語。外れ値の行動。

これらのエッジケースはモデルを壊すのではなく、モデルを作ります。

モデルが知っていることは、どのように構築されているかよりも重要です。特にLLMが商品化されるにつれて。データは新しい差別化要因であり、最も価値のあるデータは公共のウェブからではなく、エッジから来るのです。

データが所有され、許可され、生きている場所で。

そしてここにキッカーがあります—中央集権的なAIモデルは混乱にアレルギーがあります。彼らは好奇心ではなく、コンプライアンスのために最適化されています。

しかし、混乱こそが意味が存在するところです。DAOガバナンスフォーラム、周辺科学のサブレディット、または地方のWhatsAppグループからの音声メッセージで訓練されたモデルは、世界を異なる視点で理解します。単にオートコンプリートするだけでなく、文脈を持たせてより深い視点を生み出します。

データがどこから来るのか、誰がそれを管理しているのかを考えずにAIを構築しているなら、知性を構築しているわけではありません。ただの合意形成をスケーリングしているだけです。