كل LLM رئيسي يتغذى من نفس مصدر البيانات - Reddit وWikipedia وStack Exchange، لكن مالكي المنصات بدأوا يدركون قيمة بياناتهم، ويجعلون عملية السحب أصعب وأصعب.

النتيجة هي تقلص الإنترنت العام، ونسبة أكبر من الفوضى في الذكاء الاصطناعي فيما تبقى. لن نتمكن من تدريب AGI على الويب في 2025. ليس فقط لأنه صغير جدًا، بل إن الكميات الهائلة من البيانات الاصطناعية تشوه توزيع مجموعة التدريب. سيؤدي هذا إلى المزيد من الإجابات المتوسطة، وفي النهاية إلى انهيار النموذج.

هل هذه هي المستقبل؟ خليط رمادي من المتوسط؟ لا.

الفتح الحقيقي هو البيانات اللامركزية. ليس فقط من أجل الخصوصية، وليس فقط من أجل الأصل - ولكن أيضًا من أجل الإشارة.

للحصول على بيانات عالية الجودة وذات تنوع عالٍ للتدريب المستقبلي، سيكون من الضروري تحسين نماذج الذكاء الاصطناعي على خزائن البيانات التي يملكها المستخدمون.

تتدرب النماذج على الغريب، والبرية، والواقع. الثقافات الفرعية. اللغات المحلية. سلوك الشذوذ.

هذه الحالات الحدودية لا تكسر النموذج - بل تجعل النموذج.

ما يعرفه النموذج أهم من كيفية بنائه، خاصةً مع commoditization في LLMs. البيانات هي المميز الجديد، وأهم البيانات لن تأتي من الويب العام - بل ستأتي من الأطراف.

حيث تكون البيانات مملوكة ومصرح بها ونشطة.

وها هي النقطة الرئيسية - نماذج الذكاء الاصطناعي المركزية حساسة للفوضى. إنها محسّنة للامتثال، وليس للفضول.

لكن الفوضى هي المكان الذي تعيش فيه المعاني. نموذج تم تدريبه على منتديات حوكمة DAO، أو subreddit للعلوم الهامشية، أو ملاحظات صوتية من مجموعات WhatsApp الريفية يفهم العالم بشكل مختلف. إنه لا يكتفي بالتكملة التلقائية - بل يس contextualizes لإنتاج منظور أعمق.

إذا كنت تبني ذكاءً اصطناعيًا دون التفكير في مصدر البيانات، أو من يتحكم بها، فأنت لا تبني ذكاءً. أنت فقط تقوم بتوسيع الإجماع.