文 | 定焦One?王璐

編集 | 魏佳

身体智能(具身智能)赛道持续吸引资本目光的同时,各类相关榜单也越来越多。当“第一”几乎成为各家标配时,榜单还有可信度吗?

一个多月前,千寻智能就经历了尴尬时刻。6月初,其具身基座模型Spirit v1.6在RoboArena榜单上以1918分的成绩超过了英伟达Cosmos3的1880分,一度位居「世界第一」。紧接着,千寻宣布完成15亿元A+轮融资,三个月内累计完成四轮密集融资,总额接近50亿元,創下身体智能赛道的融资频率新高。

ただ、業界内部での評価データに対する疑念は、ほぼ翌日からすぐに熱を帯び始めた。ある観察者は、310回の評価記録のうち72%のスコアが2つのアカウントから出ていると指摘する。さらに注目すべきなのは、RoboArena公式がその後声明を出し、遡って調査した結果、疑わしい評価データの一部を削除し、ランキング順位を更新したことだ。Spirit v1.6もそれに伴い、ランキングから除名された。

しかし、この出来事でプレイヤーの熱が冷めたわけではない。直近半年ほどの業界ニュースを開けば、星動紀元、原力灵机、极佳视界、智元、跨维、鹿明……ほぼすべての大手企業が「第一」をひとつは握っており、その「第一」の中身はそれぞれ違う。

この光景は、たぶん理解しやすい。体性感知(具現化)知能は現時点で技術ルートが統一されておらず、実機での成功率も多くは50〜60%程度にとどまる。外部がある会社が本当にできるかどうかを判断するには、大きく言ってランキングに頼るしかない。しかし、発表するのが既存の大学や機関に加えてメディアまで入り、各社の基準がバラバラで、さらに商談や利害関係が絡む場合、ランキング自体を物差しとして使えるのか——それが問題になる。

具現化の領域を注視している投資家は、ランキングはより市場行動に寄っており、投資判断の参考としては最大でもそれくらいだと打ち明ける。彼は千尋の件に驚いていない。彼の見立てでは、順位を本当に気にするのは、財務や技術から出発しているのではなく、むしろ地方の誘導ファンドや国資寄りの資金のようなところであり、「第一」とは彼らが「レポートに書くときの、比較的よい入口」になり得る。とはいえ、別の投資家は違う見方をしている。技術の参入障壁が高く、情報の非対称がある初期段階のレーンでは、ランキングは少なくとも横断的な比較の出発点を提供してくれる、と考えている。

「第一」の数が、真面目にロボットを作っている会社の数より多くなったとき、これらのランキングは技術を測っているのか、それとも物語を語る能力を測っているのか? どのランキングはまだ見に値するのか?

01 技術ルートが統一されていないため、先行者が皆それぞれ「第一」を持つ

まず、現在市場にあるランキングを整理してみよう。大まかな印象を作るためだ。不完全な統計によれば、現在の具現化知能のアクティブなランキングは20以上にも達する。評価内容から見ると、これらはおおむね3種類に分類できる。

VLA操作総合ランキングは、ロボットが本当に仕事をできるかを問う。タスク成功率が評価軸で、代表的なランキングはRoboChallenge Table30、MolmoSpaces。

ワールドモデル・ランキングは、頭の中での推論が正しいかを問う。物理世界に対する推論を評価し、ロボットの手足が器用かどうかは問わない。代表例はWorld ArenaとWorldModelBench。

専門ベンチマークランキングは、「極端な状況でバレないか」を見る。たとえば両腕の協調や、シミュレーションから実機への移行といった単点の極端な能力を対象にする。代表例はRoboTwin 2.0、SimplerEnv、LIBERO、CALVIN。この価値は、総合ランキングでは届かない極端なシーンで、モデルの弱点をあぶり出せることにある。

付け加えると、この3種類のランキングはそれぞれ重点が異なり、互いに代替はできない。実機ランキングは実行を測り、ワールドモデルランキングは推論を測り、専門ランキングは境界を測る。どれも具現化知能のすべての能力をカバーできない。

この座標があれば、直近半年の具現化基盤モデルの戦績は整理して当てはめられる。さらに直近2か月の戦報をまとめれば、かなり壮観なリストが得られる。

今年5月、星動紀元Era0はRoboChallenge Table30の1位を獲得したと主張した。智元GE-Sim 2.0はWorld Arena Track1の1位。跨维DSCFuncWorldはWorld Arena Track2の1位。6月に入ると、千尋Spirit v1.6がRoboArenaの1位を獲得(その後除名)、鹿明Prime R0がMolmoSpacesでトップに躍り出た。ほぼどの会社も「1位」なのに加えて、具体的なランキング順位が“裏取り”として付いている。

そして混乱や乱れも、さまざまなランキングから始まっている。

最も分かりやすいのは、首位が寿司屋のカウンターのように次々と入れ替わり、「第一位」の入れ替わりが頻繁だという点だ。

RoboChallenge Table30での首位。過去半年で少なくとも4回入れ替わっている。まず千尋Spirit v1.5が成功率50.33%で記録を更新し、すぐに極佳视界GigaBrain-0.1、米国ボストン・ダイナミクスのAtlas、星動紀元Era0が次々にこれを上回った。

このスピードは、大規模言語モデルの主流ランキングよりずっと速い。2023年から2025年にかけて、GPT-4、Claude 3、Gemini 1.5がMMLUやGSM8Kなどのランキングで首位に立つケースは、通常数か月〜1年近く守られる。たとえ2020年から2022年の高速イテレーション期でも、GPT-3やPaLMは「月単位」ではなく「月で入れ替える」ペースだった。「今の具現化知能では、単一モデルが覇権(首位)を一週間守れたら、むしろ簡単ではない」と、ある大手具現化知能企業の関係者、米范は述べている。

主な理由は2つある。1つは物理世界のランダム性だ。同じモデルを実機で2回走らせたとき成功率が3〜5ポイントぶれるのは普通で、照明、物体の位置、ロボットアームの公差などが結果に影響する。一方、MMLUのような大規模言語モデルのランキングは固定問題で決定論的な採点。モデルを同じく100回回してもスコアはほぼ変わらない。もう1つはテストタスクの公開度だ。RoboChallengeのTable30のように、30項目のタスク分布が公開されていれば、各社はタスクに合わせてデータを収集し、モデルを微調整してから提出できる。結果として、首位の「鮮度(保ち期間)」は週単位に押し下げられる。

さらに混乱させるのは、同じランキングの中に同時に複数の「第一」が現れることだ。

World Arenaは典型例だ。智元GE-Sim 2.0や跨维DSCFuncWorldは対外的に「World Arenaで首位」を名乗っているが、実際にはこのランキングには複数の競技カテゴリ(レーン)が含まれている。智元GE-Sim 2.0はTrack1(知覚と行動応答)で68.26点の1位、跨维DSCFuncWorldはTrack2(データエンジン)で1位だ。「第一」は異なる個別サブランキングに属するのに、対外的には同じ一文としてまとめて書かれている。

レーンの区分に不慣れな読者にとって、2社が並んでいる「World Arena第一」のような言い方はほとんど見分けがつかない。場合によっては、誰かが嘘をついているのではないかと疑うことすらある。でも実際には誰も間違ったことは言っていない。精密でないだけだ。

もう一つ、より曖昧な領域がある。ランキングの性質が混在しているのに、「第一」の価値が同じランクとして暗黙に扱われてしまい、誤解を生みやすい。

一部の会社の対外的な説明では、しばしば同時に「あるモデルがRoboChallengeで1位」や「ある具現化知能メディアの評価でも1位」と並べて出している。前者は24時間×7日、実機を回して出た成功率。後者は編集部が閉じた場で議論して決めたもの、あるいは商談の結果として固めたリストの可能性がある。両者を同じ文章に並べれば、含意は同じランクのように扱われてしまう。

その中で最も曖昧なのは「産業(ビジネス)ランキング」だ。あるランキングが「産業」を名乗っていても、それは実機で固定して評価される“ハードな”ランキングでもなければ、学術機関が裏付けるベンチマークでもない。コンサル会社やメディアが共同で作った採点ランキングであることが多い。こうした事例はLLMの世界でも起きていたが、学術ランキング、商用評価、メディアランキングが徐々に層分けされるにつれ、「ダブルで第一」が徐々に解体されていった。一方、具現化知能は、いままさにまだ層分けされていない段階にある。

3つの現象が重なる結果、ランキングの「第一」は深刻にインフレ(インフレ化)している。しかもこのインフレはマーケティングの段階にとどまらない。「第一」の肩書きはしばしば注目度、リソース、そして実際の評価額の上乗せにつながる。

02 「第一」はどうやって作られるのか?

ランキングが真のお金と実際の資源を動かせるなら、「第一」をどう作るかも「潜りルール」として形成される。業界関係者は、千尋Spirit v1.6は極端な例にすぎないが、業界で「第一」を作る現象は決して珍しくないと説明し、手法は大体3種類だという。

コストが最も低く、かつ最も一般的なやり方は、トーク(セールストーク)を包むことだ。「単科第一」が「総合点第一」になり、核心は重要な限定語を省くことにある。

たとえば実際には「RoboTwin 2.0 両腕協調VLA系のCleanデータで1位」を取っているのに、対外的には「RoboTwin 2.0で首位」となる。実際には「LIBERO-Plusの場面一般化のための専門(スペシャル)ベンチ1位」なのに、対外的には「LIBERO-Plusの首位」になる。データの捏造はないし、成績も本物だが、「第一」が指す範囲が人為的に拡大されている。

2つ目の方法は、「刷題」などで結果を直接操作することだ。

一条是「問題を出題に合わせて練習する」。ランキングで公開されるタスク配分、評価基準、環境パラメータなどは、特定の後訓練(フォーカスド訓練)にそのまま利用できる。タスクが比較的固定されているランキングほど、とりわけその傾向が見えやすい。各社は繰り返し「問題を刷り込む(刷題する)」ことで、特定のシナリオに過適合し、高得点を得ることができる。

米范によれば、具現化領域の一部ランキングではテストタスクが公開されているため、各社はこれらのタスクに向けてデータを収集し、モデルを微調整してから提出することができる。これは具現化のコミュニティでは正常な反復(イテレーション)と見なされ、不正行為(チート)には当たらない。LLM領域で語られる「データ漏洩、データ汚染」とは本質的に別物だ。

もう一つは、評価メカニズムの抜け穴を突くこと。評価の権威性が高くても、仕組みに穴があることがある。たとえばRoboArenaはオープン登録と分散型評価を採用し、本来はより多くの人に参加してもらう狙いだったが、結果として3つの抜け穴が残っている。

1つ目は、評価者の身分に門戸がないこと。誰でも登録して裁判(評価者)になれる。短期間に大量の新規アカウントが同じモデルを評価すると、そのEloスコアを素早く引き上げられる。

2つ目は、マッチングが強制的に全員と対戦するわけではないこと。?ランダムに対戦相手を割り当てるからといって、その同期のランキング上位者全員と必ず一回ずつ戦うとは限らない。評価者がタスクを受け取る時、Aは固定で、Bはスコアが近いモデルの中からランダムに抽出される。サンプル数が十分でない場合、2つのモデルが一度も対戦せずに終わることも十分に起こりうる。たとえばSpirit v1.6の初期段階ではDreamZeroと戦い、23戦後に停戦。5月30日にランキング入りしたNVIDIAのCosmos3-Nano-Policyとは対戦がゼロだった。

3つ目は、集中的に刷評すること。複数のアカウントで自社モデルを密に評価し、ネガティブな記録を減らす。たとえばSpirit v1.6の310回の評価記録では、72%のスコアがECUSTとRobotics Labの2つのアカウントから出ている。それらは224回の評価で97%の勝率を引き出し、Spirit v1.6を1位に押し上げた。しかしNVIDIAは同じ条件で自社評価を21回行ったところ、勝率は0%だった。2つのデータを並べると、実務者はすぐに疑いを持つ。

事後、RoboArenaはルールを補った。評価者は利益関係のない第三者でなければならず、自刷り用アカウントの入口を塞ぐ。評価完了率が20%未満のアカウントは疑わしいものとして扱い、「選択的マッチング」を防ぐ。処理ののち、千尋はランキングから落ちた。

もう一つ、最も隠れていて、かつ最も蔓延しているのは、リソースの交換だ。ランキングをそのまま商売として作ってしまう。

多くのメディア系ランキングでは、選考基準が透明ではない。中には、被評価対象との間に商取引上の協業がある場合すらある。双方で共同して「権威レポート」を出し、メディアのランキングと学術ベンチマークを並べて“包装”する。技術もデータも関係ないのは、予算と関係性だけが問題になるからだ。業界関係者の中には、ランキング刷りや買いのような現象は珍しくないと述べる人も複数いる。

これら3つの手法はしばしば重なり合う。まずは的を絞った訓練や抜け穴突きで分数を刷り上げ、次にレーンのすり替えで出所を隠し、最後にトークで対外に発信し、必要ならメディア系ランキングの裏付けも買う。こうした多層包装の末、「第一」はできあがる。

こうした手口は、業界の内部では秘密ではない。本当の問題は、それを見抜くには一定の技術的素養が必要で、技術が複雑であればあるほど、素人には見分けにくい一方で、物語は語りやすいという点だ。

03 水分を取り除いたら、何を信じるべき?

単に一人の体性感知(具現化)知能の実務者だけでなく、彼らは今はランキング順位をあまり見ていないと認めている。ランキングは刷れるし買える。すべてが形式的に適法であっても、物理環境の複雑さにより、データを100%正確にすることは難しいからだ。

さらに深い問題は、この業界には現時点で「汎用の物差し」がまだないことだ。

具現化知能の実務者gasheroは、「炒り卵」と「冷やし料理(和え物)」でたとえをした。ロボットAは炒り卵が得意で成功率90%、ロボットBは冷やし料理が得意で成功率85%だが、だからといってAがBより強いといえるわけではない。炒り卵はつかみと返しが問われ、冷やし料理は正確に具材を注ぎ、かき混ぜることが問われる。2つのスキルは別物で、難度も違い、評価基準も違う。現状の具現化知能のレーンには統一基準がなく、「炒り卵の能力」と「冷やし料理の能力」を同じ採点体系に換算できない。

ただし、ランキングにまったく価値がないわけではない。実務者は概ね、ランキングには依然として参考価値があると考えている。重要なのは、何を見るべきかを知り、見た後にさらに何を見るべきかを知ることだ。

業界での総合的なコンセンサスでは、本当に信頼できるランキングは、概ね次の3つの特徴を同時に備えている。

1つ目は、項目別に透明性があることで、「ただ一つの『第一』だけを放り投げる」のではない。

総合ランキングでも専門ランキングでも、信頼できるやり方は細目を一つ一つ分解して示すことだ。たとえばRoboChallenge Table30では、30項目の日常タスクの総合成功率を測る。信頼できるのは、読者に64.33%という総合数字だけでなく、30項目のうちどれができていてどれがつまずいているかも見せるからだ。総点だけ報告して細目を出さないランキングの価値は大きく下がる。

2つ目は、評価が第三者によって管理され、かつ「刷題」対策の設計があること。

MolmoSpacesはファインチューニングを許さず、モデルはそのまま「裸テスト」。LIBERO-Plusは、照明の急変、背景のごちゃつき、カメラ角度の変化といった極端な攪乱を加え、暗記だけで得点するのを防ぐ。それらの共通点は、刷題を難しくし、一般化を本当のハードルにすることだ。

3つ目は、評価メカニズムを見るのであって、更新頻度を見るのではない。

更新が遅いランキングが必ずしも信頼できるとは限らないし、更新が速いランキングも必ずしも刷れるとは限らない。更新が遅いのは、実機評価のコストが非常に高いからかもしれない。たとえばRoboChallengeでは、1回の完全な評価サイクルが数週間かかる場合がある。30項目のタスクを各10回、合計300回の実機試行、しかも7×24時間の連続運転——これは物理世界側のコスト制約だ。一方、更新が速いのはメカニズム設計によるものだ。たとえばRoboArenaはElo評価システムで動的ランキングを行い、毎日新しい対戦データが入ってくるので、順位は自然に毎日更新される。この「速さ」自体は問題ではなく、その信頼性はメカニズムが厳密か、穴が塞がれているかにかかっている。

しかし、みんながランキングには“水分(不純物)”があることを知っているのに、なぜ皆が必死に刷っているのか?

答えは、業界がいまどの段階にあるかにある。

今起きている「第一」の奪い合いは、本質的には資本の不安の産物だ。今年は具現化の基盤モデルが密にアップデートされる年で、初期のレーン(早期市場)の出荷量、売上、受注量はいずれも不安定だった。そのためランキングで“埋める”しかない。資金調達主導の段階が変わらない限り、刷りランキングのような行為は止まらない。

業界が次の段階に入れば、評価の物差しは自然に切り替わる。たとえば、毎年いくつの台を納品したか、固定顧客がいるか、利益が出ているか。そうなれば、「第一」のインフレは自然に収まり、ランキングは本来あるべき場所に戻る。

あるいは、ランキングを急いで刷るのではなく、ロボットを生産ラインに送り込むことに専念している会社こそが、業界の本当の答えなのかもしれない。

(取材協力者の要望により、文中の「米范」は仮名)