すべての主要なLLMは同じデータのたまり場(Reddit、Wikipedia、Stack Exchange)から飲んでいますが、プラットフォームの所有者たちは自分たちのデータの価値に気づき始めており、スクレイピングをますます難しくしています。
その結果、公共のインターネットは縮小し、残されたものの中にはより多くのAIの雑多な情報が含まれることになります。2025年のウェブでAGIを訓練することはできなくなります。サイズが小さすぎるだけでなく、大量の合成データがトレーニングセットの分布を歪めます。これにより、よりベージュで平均的な回答が増え、最終的にはモデルの崩壊につながります。
これが未来ですか?平均的なベージュのスラリー?いや。
本当の解放は分散データです。プライバシーのためだけではなく、出所のためだけでもなく、シグナルのためでもあります。
将来のトレーニングのために高品質で高エントロピーのデータを調達するには、主権を持つユーザー所有のデータボールトでAIモデルを微調整する必要があります。
モデルは奇妙で、野生で、現実的なものに基づいて訓練されます。サブカルチャー。地方言語。外れ値の行動。
これらのエッジケースはモデルを壊すのではなく、モデルを作ります。
モデルが知っていることは、どのように構築されているかよりも重要です。特にLLMが商品化されるにつれて。データは新しい差別化要因であり、最も価値のあるデータは公共のウェブからではなく、エッジから来るのです。
データが所有され、許可され、生きている場所で。
そしてここにキッカーがあります—中央集権的なAIモデルは混乱にアレルギーがあります。彼らは好奇心ではなく、コンプライアンスのために最適化されています。
しかし、混乱こそが意味が存在するところです。DAOガバナンスフォーラム、周辺科学のサブレディット、または地方のWhatsAppグループからの音声メッセージで訓練されたモデルは、世界を異なる視点で理解します。単にオートコンプリートするだけでなく、文脈を持たせてより深い視点を生み出します。
データがどこから来るのか、誰がそれを管理しているのかを考えずにAIを構築しているなら、知性を構築しているわけではありません。ただの合意形成をスケーリングしているだけです。
その結果、公共のインターネットは縮小し、残されたものの中にはより多くのAIの雑多な情報が含まれることになります。2025年のウェブでAGIを訓練することはできなくなります。サイズが小さすぎるだけでなく、大量の合成データがトレーニングセットの分布を歪めます。これにより、よりベージュで平均的な回答が増え、最終的にはモデルの崩壊につながります。
これが未来ですか?平均的なベージュのスラリー?いや。
本当の解放は分散データです。プライバシーのためだけではなく、出所のためだけでもなく、シグナルのためでもあります。
将来のトレーニングのために高品質で高エントロピーのデータを調達するには、主権を持つユーザー所有のデータボールトでAIモデルを微調整する必要があります。
モデルは奇妙で、野生で、現実的なものに基づいて訓練されます。サブカルチャー。地方言語。外れ値の行動。
これらのエッジケースはモデルを壊すのではなく、モデルを作ります。
モデルが知っていることは、どのように構築されているかよりも重要です。特にLLMが商品化されるにつれて。データは新しい差別化要因であり、最も価値のあるデータは公共のウェブからではなく、エッジから来るのです。
データが所有され、許可され、生きている場所で。
そしてここにキッカーがあります—中央集権的なAIモデルは混乱にアレルギーがあります。彼らは好奇心ではなく、コンプライアンスのために最適化されています。
しかし、混乱こそが意味が存在するところです。DAOガバナンスフォーラム、周辺科学のサブレディット、または地方のWhatsAppグループからの音声メッセージで訓練されたモデルは、世界を異なる視点で理解します。単にオートコンプリートするだけでなく、文脈を持たせてより深い視点を生み出します。
データがどこから来るのか、誰がそれを管理しているのかを考えずにAIを構築しているなら、知性を構築しているわけではありません。ただの合意形成をスケーリングしているだけです。