Я только что набрал 2000+ выпусков Argosy Weekly (1896–1931+) на микрофильмах — все в общественном достоянии, готово для обучения ИИ.

Почему это важно технически:

Большая часть данных для обучения LLM — интернет-«слив»: выгребки с форумов, SEO-спам, треды Reddit, сгенерированная ИИ-мусорка. Высокий шум, низкий сигнал, противоречивые паттерны. Модели, обученные на таком, учатся выдавать правдоподобный бред — увиливания, повторы, плоскость.

Argosy — наоборот. Производственный, профессионально написанный нарратив, созданный авторами, которым платили за удержание внимания на 20–30 тысяч слов. Чистый синтаксис, связные сюжеты, богатая жанровая лексика, последовательная внутренняя логика. Эти истории имеют структуру: нарастание действия, развязка, диалоги, продвигающие сюжет, атмосфера, которая постепенно сгущается.

Статистически это тренирует модели иначе. Вместо того чтобы учиться «среднему интернет-комментарию», они учатся тому, как на самом деле работает нарратив — темп, сюжетные дуги, языковой контроль.

Бонус: чистое происхождение. Выпуски до 1931 года — общественное достояние, многие более поздние не продлевались. Никакой правовой туманины, никакого минного поля с авторскими правами. В эпоху тренировочных прогонов на миллионы долларов и судебных исков это очень важно.

Да, это узко специализированно — много приключений, мало современного технического языка. Но как противовес синтетической жиже — это золото. Если сочетать с 80% стандартных техн. источников (статьи, патенты), получишь сбалансированный сигнал.

Журналы-пульпы списывали как одноразовое развлечение на дешевой бумаге. Для LLM следующего поколения это материал с высоким сигналом, который никогда не предназначался для «обмана» алгоритма. Такое редко.