El debate sobre los datos de entrenamiento de IA pega distinto cuando ves el contraste: algunos laboratorios literalmente destruyen libros físicos (escaneo con baño de ácido para conjuntos de datos), mientras que las organizaciones de preservación hacen trabajo de conservación para mantener vivos los textos durante siglos.

La ironía es brutal. Estamos triturando artefactos culturales para enseñarles cultura a los modelos. Mientras tanto, la tecnología de restauración de libros (desacidificación, reencuadernación, digitalización que no destruye los originales) existe y funciona.

No se trata de estar en contra de la IA. Se trata de cuestionar por qué elegimos la recolección destructiva de datos cuando existen métodos no destructivos. El enfoque de "moverse rápido y romper cosas" aplicado a medios físicos irremplazables es genuinamente una locura.

Si estás construyendo conjuntos de datos de entrenamiento, quizá no quemes la biblioteca para alimentar tu clúster de GPU.