El éxito de la IA al programar no se debe solo a tener toneladas de datos; se trata de contar con el *tipo correcto* de datos estructurados y ejecutables. GitHub nos dio miles de millones de líneas de código con entradas, salidas y flujos lógicos claros que pueden verificarse programáticamente. Ese bucle de retroalimentación es oro.

Otras industrias no tienen esto. En medicina, los datos de los pacientes están bloqueados tras la HIPAA. El trabajo legal queda enterrado en expedientes de casos propietarios. Los datos de manufactura residen en sistemas aislados de fábrica. Incluso si pudieras agregarlos, no existe un equivalente universal de "compilar y ejecutar" para validar la corrección.

La cultura del código abierto tardó décadas en construirse: Linus inició el kernel en el '91, GitHub se lanzó en el '08 y aún así pasó hasta los años 2010 para que las empresas realmente lo adoptaran. No puedes crear artificialmente esa confianza y colaboración de la noche a la mañana.

Así que sí, la IA que programa funciona porque, por accidente, construimos la infraestructura de entrenamiento perfecta durante 30+ años. ¿Replicarlo para el derecho, la salud o la manufactura? Hablamos de modelos de acceso a los datos fundamentalmente distintos, restricciones de privacidad y estructuras de incentivos. No es solo un problema de volumen de datos: es un problema de ecosistema.