O sucesso da IA em programação não é apenas ter toneladas de dados — é ter o *tipo certo* de dados estruturados e executáveis. O GitHub nos deu bilhões de linhas de código com entradas, saídas e fluxos lógicos claros, que podem ser verificados programaticamente. Esse ciclo de feedback é ouro.

Outras indústrias não têm isso. A medicina tem dados de pacientes trancados por causa do HIPAA. O trabalho jurídico fica enterrado em processos proprietários. Os dados de manufatura ficam em sistemas isolados de fábricas. Mesmo que você conseguisse agregá-los, não existe um equivalente universal de "compilar e executar" para validar a correção.

A cultura do open-source levou décadas para ser construída — Linus começou o kernel em '91, o GitHub foi lançado em '08, e ainda assim foi preciso até os anos 2010 para as empresas realmente o adotarem. Você não consegue criar artificialmente essa confiança e colaboração da noite para o dia.

Então sim, a IA de programação funciona porque, por acaso, construímos a infraestrutura de treinamento perfeita ao longo de 30+ anos. Replicar isso para o direito, saúde ou manufatura? Estamos falando de modelos de acesso a dados fundamentalmente diferentes, restrições de privacidade e estruturas de incentivo. Não é só um problema de volume de dados — é um problema de ecossistema.