最近、私は KGeN を改めて理解しました。AI に本当に足りないのは、もしかすると「もっと多くのデータ」ではないかもしれません。》
最近 KGeN の研究をしてみて、私がいちばん強く感じたのはこうです:
AI のデータが増えるほど、「データは本当に人間由来なのか」がむしろ重要になる可能性があるということです。
以前、AI プロジェクトがデータについて語っているのを見ると、私は基本的にあまり長く立ち止まりませんでした。なにしろ今では、ネット上には何でもデータがあります。
でも、問題はまさにそこにあります。
AI が生成した記事、画像、音声がますます増えていて、さらにロボットのアカウントも普及しています。これからもし AI が、大量に「すでに AI が生成した」コンテンツを学習するようになったら、ループが起きないでしょうか?
AI 生成 → AI 学習 → 再生成 → 再トレーニング AI。
量はどんどん増えるのに、実際の人間の経験は逆に減ってしまうかもしれません。
それが私が KGeN を真剣に見るようになった理由でもあります。
KGeN は現在、自分たちを Verified Human Network(検証済みの人間ネットワーク)と位置付けており、コアとなる方向性は、検証された本物の人間とマルチモーダルデータを獲得し、Physical AI と LLM に活用することです。公式が挙げているデータの種類には、音声、視覚、動作、触覚が含まれており、60+ の国々をカバーしています。
ここで最も考えるべき価値があるのは、「AI」というホットな概念そのものではなく、むしろ次の問いだと思います:
将来 AI が現実世界を本当に理解するなら、まず本物の人間を理解する必要があるのではないでしょうか?
たとえばロボットが実際の環境で暮らせるようになるには、単にインターネット上の画像を見るだけでは到底足りないはずです。
人がどう話し、どう行動し、環境をどう観察するか、さらには人がさまざまな場面でどんな反応をするのかを知る必要があります。
このとき、本物の人間データはもはや「データ量」の問題ではなく、「データの出どころ」と「品質」の問題になります。
KGeN の今の考え方は、実在の人間、検証済みのマルチモーダルデータ、そして AI の学習ニーズをつなげることです。製品群の中には K-Quest も含まれており、検証済みの人間がタスクを完了することで、Physical AI と LLM に必要なマルチモーダルデータを収集します。
もちろん、私は今すぐ「KGeN が必ず成功する」とは言いません。
私にとって、これからも注目する価値があるのは次の点です:
本物のユーザーが継続的に増えていくのか?
データ需要が継続的に生まれるのか?
それらのデータは本当に AI 企業に使われるのか?
そして最終的に、長期的なビジネスのクローズドループを形成できるのか?
これらの問いは、短期的な価格だけを見るよりずっと面白いと思います。
この答えは、私はまだ引き続き観察しています。
#KGen