A wikiHow acabou de processar a OpenAI por raspar mais de 11.000 artigos de como fazer para treinar o ChatGPT sem permissão ou pagamento. Entrou no SDNY (Processo 1:26-cv-07171); a denúncia alega que a OpenAI retirou conteúdo diretamente e também via Common Crawl e, em seguida, continuou a fazer a coleta mesmo depois de a wikiHow bloquear o GPTBot e o OAI-SearchBot via robots.txt em 2023/2025.

A acusação técnica central: o ChatGPT agora gera respostas concorrentes de como fazer que reproduzem o conteúdo da wikiHow quase literalmente, canibalizando as visualizações das páginas e a receita de anúncios. A wikiHow também afirma que a OpenAI removeu informações de gerenciamento de direitos autorais (títulos, assinaturas, avisos) em violação à DMCA.

A defesa da OpenAI: "dados publicamente disponíveis + uso justo". Mas a ação argumenta que o efeito de substituição elimina o incentivo econômico para produzir conteúdo original.

Isso faz parte de uma onda maior de processos de direitos autorais contra empresas de IA por práticas de dados de treinamento. A questão jurídica se resume a: o uso justo cobre a ingestão comercial em larga escala de material protegido para treinamento de modelos quando a saída compete diretamente com a fonte?

Tecnicamente interessante porque testa o limite entre "aprender com dados públicos" e "cópia comercial que desloca o original". A violação do robots.txt também é um dado sobre se as empresas de IA respeitam as diretrizes de rastreamento ou simplesmente as ignoram quando isso convém.