Chaque LLM majeur boit à la même auge de données—Reddit, Wikipedia, Stack Exchange, mais les propriétaires de la plateforme ont commencé à réaliser la valeur de leurs données et rendent le scraping de plus en plus difficile.
Le résultat est un internet public en rétrécissement, et une plus grande proportion de déchets d'IA dans ce qui reste. Nous ne serons pas en mesure de former une AGI sur le web de 2025. Non seulement il est trop petit, mais les vastes quantités de données synthétiques faussent la distribution de l'ensemble d'entraînement. Cela conduira à des réponses plus beiges, moyennes, et enfin à l'effondrement du modèle.
C'est ça, l'avenir ? Une boue beige de la moyenne ? Non.
La véritable clé est des données décentralisées. Pas seulement pour la vie privée, pas seulement pour la provenance—mais aussi pour le signal.
Pour sourcer des données de haute qualité et à haute entropie pour un futur entraînement, il sera nécessaire de peaufiner les modèles d'IA sur des coffres de données souverains et détenus par les utilisateurs.
Les modèles sont formés sur le bizarre, le sauvage, le réel. Les sous-cultures. Les langues locales. Les comportements atypiques.
Ces cas extrêmes ne brisent pas le modèle—ils le construisent.
Ce qu'un modèle sait compte plus que la façon dont il est construit, surtout à mesure que les LLM se commodifient. Les données sont le nouveau facteur de différenciation, et les données les plus précieuses ne viendront pas du web public—elles viendront des marges.
Là où les données sont possédées, autorisées et vivantes.
Et voici le hic—les modèles d'IA centralisés sont allergiques au désordre. Ils sont optimisés pour la conformité, pas pour la curiosité.
Mais le désordre est là où réside le sens. Un modèle formé sur des forums de gouvernance DAO, des sous-reddits de science marginale, ou des notes vocales de groupes WhatsApp ruraux comprend le monde différemment. Il ne fait pas que compléter automatiquement—il contextualise pour produire une perspective plus profonde.
Si vous construisez de l'IA sans penser à la provenance des données, ou à qui les contrôle, vous ne construisez pas d'intelligence. Vous ne faites que scaler le consensus.
Le résultat est un internet public en rétrécissement, et une plus grande proportion de déchets d'IA dans ce qui reste. Nous ne serons pas en mesure de former une AGI sur le web de 2025. Non seulement il est trop petit, mais les vastes quantités de données synthétiques faussent la distribution de l'ensemble d'entraînement. Cela conduira à des réponses plus beiges, moyennes, et enfin à l'effondrement du modèle.
C'est ça, l'avenir ? Une boue beige de la moyenne ? Non.
La véritable clé est des données décentralisées. Pas seulement pour la vie privée, pas seulement pour la provenance—mais aussi pour le signal.
Pour sourcer des données de haute qualité et à haute entropie pour un futur entraînement, il sera nécessaire de peaufiner les modèles d'IA sur des coffres de données souverains et détenus par les utilisateurs.
Les modèles sont formés sur le bizarre, le sauvage, le réel. Les sous-cultures. Les langues locales. Les comportements atypiques.
Ces cas extrêmes ne brisent pas le modèle—ils le construisent.
Ce qu'un modèle sait compte plus que la façon dont il est construit, surtout à mesure que les LLM se commodifient. Les données sont le nouveau facteur de différenciation, et les données les plus précieuses ne viendront pas du web public—elles viendront des marges.
Là où les données sont possédées, autorisées et vivantes.
Et voici le hic—les modèles d'IA centralisés sont allergiques au désordre. Ils sont optimisés pour la conformité, pas pour la curiosité.
Mais le désordre est là où réside le sens. Un modèle formé sur des forums de gouvernance DAO, des sous-reddits de science marginale, ou des notes vocales de groupes WhatsApp ruraux comprend le monde différemment. Il ne fait pas que compléter automatiquement—il contextualise pour produire une perspective plus profonde.
Si vous construisez de l'IA sans penser à la provenance des données, ou à qui les contrôle, vous ne construisez pas d'intelligence. Vous ne faites que scaler le consensus.