Каждый крупный LLM пьет из одного и того же источника данных — Reddit, Wikipedia, Stack Exchange, но владельцы платформ начали осознавать ценность своих данных и делают скрейпинг все сложнее и сложнее.
Результат — это сужение публичного интернета и большая доля AI-смеси в том, что осталось. Мы не сможем обучить AGI на вебе 2025 года. Он слишком мал, а огромные объемы синтетических данных искажают распределение обучающего набора. Это приведет к более бежевым, средним ответам, и, в конечном итоге, к коллапсу модели.
Это будущее? Бежевое месиво среднего? Нет.
Настоящее открытие — децентрализованные данные. Не только для конфиденциальности, не только для происхождения, но также и для сигнала.
Для получения высококачественных, высокоэнтропийных данных для будущего обучения будет необходимо донастраивать AI модели на суверенных, принадлежащих пользователям хранилищах данных.
Модели обучаются на странном, диком, реальном. Субкультуры. Местные языки. Поведение выбросов.
Эти крайние случаи не ломают модель — они создают модель.
То, что знает модель, имеет большее значение, чем то, как она построена, особенно по мере того, как LLM становятся товаром. Данные — это новый дифференциатор, и самые ценные данные не будут поступать из публичной сети — они будут поступать с краев.
Где данные принадлежат, имеют разрешение и живы.
И вот в чем загвоздка — централизованные AI модели аллергичны к беспорядку. Они оптимизированы для соблюдения норм, а не для любопытства.
Но беспорядок — это то, где живет смысл. Модель, обученная на форумах управления DAO, крайних научных сабреддитах или голосовых заметках из сельских групп WhatsApp, понимает мир иначе. Она не просто автозаполняет — она контекстуализирует, чтобы создать более глубокую перспективу.
Если вы создаете AI, не задумываясь о том, откуда данные берутся или кто их контролирует, вы не создаете интеллект. Вы просто масштабируете консенсус.
Результат — это сужение публичного интернета и большая доля AI-смеси в том, что осталось. Мы не сможем обучить AGI на вебе 2025 года. Он слишком мал, а огромные объемы синтетических данных искажают распределение обучающего набора. Это приведет к более бежевым, средним ответам, и, в конечном итоге, к коллапсу модели.
Это будущее? Бежевое месиво среднего? Нет.
Настоящее открытие — децентрализованные данные. Не только для конфиденциальности, не только для происхождения, но также и для сигнала.
Для получения высококачественных, высокоэнтропийных данных для будущего обучения будет необходимо донастраивать AI модели на суверенных, принадлежащих пользователям хранилищах данных.
Модели обучаются на странном, диком, реальном. Субкультуры. Местные языки. Поведение выбросов.
Эти крайние случаи не ломают модель — они создают модель.
То, что знает модель, имеет большее значение, чем то, как она построена, особенно по мере того, как LLM становятся товаром. Данные — это новый дифференциатор, и самые ценные данные не будут поступать из публичной сети — они будут поступать с краев.
Где данные принадлежат, имеют разрешение и живы.
И вот в чем загвоздка — централизованные AI модели аллергичны к беспорядку. Они оптимизированы для соблюдения норм, а не для любопытства.
Но беспорядок — это то, где живет смысл. Модель, обученная на форумах управления DAO, крайних научных сабреддитах или голосовых заметках из сельских групп WhatsApp, понимает мир иначе. Она не просто автозаполняет — она контекстуализирует, чтобы создать более глубокую перспективу.
Если вы создаете AI, не задумываясь о том, откуда данные берутся или кто их контролирует, вы не создаете интеллект. Вы просто масштабируете консенсус.