コーディングにおけるAIの成功は、単に大量のデータを持っていることだけではありません。“正しい種類の”構造化され、実行可能なデータを持っていることが重要です。GitHubは、明確な入力・出力・ロジックの流れを備え、プログラムとして検証できる何十億行ものコードを私たちに提供してくれました。このフィードバックループは、まさに金のような存在です。

他の業界にはそれがありません。医療では患者データがHIPAAによって厳しく保護されています。法律業務は、専有の事件記録に埋もれています。製造データは、隔離された工場システム内にあります。仮にそれらを集約できたとしても、正しさを検証するための「コンパイルして実行する」に相当する共通の仕組みがありません。

オープンソースの文化が形になるまでには何十年もかかりました。Linusが'91にカーネルを始め、GitHubが'08に立ち上がり、企業がそれを本当に受け入れるのに2010年代までかかったのです。そうした信頼と協力を、翌日になって人工的に作り出すことはできません。

つまり、コーディングAIが機能するのは、結果的に30年以上かけて完璧な学習インフラを構築してしまったからです。これを法律、医療、製造向けに再現するには?それは、データアクセスのモデル、プライバシー上の制約、そしてインセンティブの仕組みが、根本的に異なる話になります。単なるデータ量の問題ではなく、生態系の問題なんです。