wikiHow acaba de demandar a OpenAI por recopilar 11,000+ artículos de cómo hacerlo para entrenar ChatGPT sin permiso ni pago. Presentado en el SDNY (Case 1:26-cv-07171), en la demanda se alega que OpenAI obtuvo contenido directamente y a través de Common Crawl, y luego siguió rastreando incluso después de que wikiHow bloqueara GPTBot y OAI-SearchBot mediante robots.txt en 2023/2025.
La acusación técnica central: ChatGPT ahora genera respuestas de cómo hacerlo que compiten y reproducen el contenido de wikiHow casi de forma literal, canibalizando las visitas a las páginas y los ingresos por anuncios. wikiHow también afirma que OpenAI eliminó la información de gestión de derechos de autor (títulos, créditos, avisos) en violación de la DMCA.
La defensa de OpenAI: "datos disponibles públicamente + uso justo". Pero la demanda sostiene que el efecto de sustitución elimina el incentivo económico para producir contenido original.
Esto forma parte de una ola mayor de demandas por derechos de autor contra empresas de IA por sus prácticas de uso de datos de entrenamiento. La cuestión legal se reduce a: ¿la doctrina de uso justo cubre la ingestión comercial a gran escala de material con derechos de autor para entrenar modelos cuando la salida compite directamente con la fuente?
Es técnicamente interesante porque pone a prueba el límite entre "aprender a partir de datos públicos" y "copia comercial que desplaza el original". La violación de robots.txt también es un dato sobre si las empresas de IA respetan las directivas de rastreo o simplemente las ignoran cuando les conviene.
La acusación técnica central: ChatGPT ahora genera respuestas de cómo hacerlo que compiten y reproducen el contenido de wikiHow casi de forma literal, canibalizando las visitas a las páginas y los ingresos por anuncios. wikiHow también afirma que OpenAI eliminó la información de gestión de derechos de autor (títulos, créditos, avisos) en violación de la DMCA.
La defensa de OpenAI: "datos disponibles públicamente + uso justo". Pero la demanda sostiene que el efecto de sustitución elimina el incentivo económico para producir contenido original.
Esto forma parte de una ola mayor de demandas por derechos de autor contra empresas de IA por sus prácticas de uso de datos de entrenamiento. La cuestión legal se reduce a: ¿la doctrina de uso justo cubre la ingestión comercial a gran escala de material con derechos de autor para entrenar modelos cuando la salida compite directamente con la fuente?
Es técnicamente interesante porque pone a prueba el límite entre "aprender a partir de datos públicos" y "copia comercial que desplaza el original". La violación de robots.txt también es un dato sobre si las empresas de IA respetan las directivas de rastreo o simplemente las ignoran cuando les conviene.
