Текст | Dingxiang One? Ван Лу
Редактор | Вэй Цзя
Пока сектор embodied intelligence продолжает постоянно привлекать внимание капитала, растёт и число различных тематических рейтингов. Когда «первое место» почти превращается в стандартный атрибут у всех игроков, остаётся ли у таблиц доверие?
Месяц назад 千寻 Intelligent пережила неловкий момент. В начале июня её базовая модель Spirit v1.6 в RoboArena показала 1918 баллов и обошла 1880 баллов Nvidia Cosmos3, ненадолго заняв место «мирова первого». Сразу после этого 千寻 объявила о завершении раунда A+ на 1,5 млрд юаней. За три месяца она провела четыре раунда плотных инвестиций на общую сумму почти 5 млрд юаней — это стало новым рекордом по частоте финансирования в секторе embodied intelligence.
Однако сомнения профессионального сообщества в качестве оценочных данных начали набирать обороты почти со следующего дня. Наблюдатели отмечали: из 310 записей оценивания 72% баллов приходятся на два аккаунта. Более того, затем официально RoboArena опубликовала заявление: после ретроспективного расследования были удалены часть спорных данных, а также обновлены позиции в таблице. Spirit v1.6 вслед за этим тоже исключили из рейтинга.
Но этот инцидент не остудил энтузиазм игроков. Если открыть отраслевые новости за почти полгода, то звёздный отсчёт «первых» есть почти у каждой компании из топа — причём «первое место» в разных измерениях. Например, у одной «первое» в одном типе задач, у другой — в другом.
Эта картинка, возможно, объяснима: путь embodied intelligence ещё не унифицирован, а успешность на реальных стендах у большинства команд застревает в диапазоне 50–60%. Со стороны, чтобы понять, правда ли компания «умеет», во многом остаётся опираться на рейтинги. Но когда публикуют их не только вузы и институты, но и медиа — при этом критерии у всех разные, а иногда ещё завязаны на коммерческие сделки и интересы, — вопрос в том, можно ли вообще использовать рейтинги как «линейку».
Один инвестор, который внимательно следит за сектором embodied, признаёт: рейтинги больше отражают рыночные действия, и максимум годятся как ориентир для инвестиционных решений. Он не был удивлён историей с 千寻. По его мнению, по-настоящему места важны не тем организациям, которые отправляются от финансов или технологий, а скорее некоторым локальным фондам или деньгам с уклоном в госсектор. «Первое место», возможно, для них как раз удобный «вход» в отчёт. Но есть и инвесторы с другой позицией: в ранней фазе, где высокий технологический порог и сильная информационная асимметрия, рейтинги хотя бы дают начальную точку для горизонтального сравнения.
Когда количество «первых мест» больше, чем у компаний, которые действительно занимаются роботами, — эти таблицы проверяют технологии или умение рассказывать истории? Какие рейтинги вообще ещё стоит смотреть?
01 Технологический маршрут ещё не унифицирован — у каждого заранее свой «первый»
Сначала разберёмся с тем, какие рейтинги есть на рынке, чтобы составить общее впечатление. По неполным подсчётам, активных рейтингов по embodied intelligence сейчас насчитывается более 20. По содержанию оценивания их в целом можно разделить на три типа.

Сводный рейтинг VLA-операций — проверяют, может ли робот реально выполнять работу. Считают процент успешных выполнений задач. Примеры — RoboChallenge Table30 и MolmoSpaces;
Рейтинг мировых моделей: проверяется, корректны ли рассуждения «в голове». Смотрят, как модель прогнозирует физический мир, а не то, насколько ловко у неё работают руки-ноги. Представители — World Arena и WorldModelBench;
Рейтинг специализированных бенчмарков: проверяют, «не вскроется ли всё при экстремальных условиях». Например, способности к предельным навыкам в одной точке — скоординированная работа двух рук, перенос из симуляции на реальный стенд. Примеры — RoboTwin 2.0, SimplerEnv, LIBERO и CALVIN. Ценность в том, что в экстремальных сценариях, где сводные рейтинги не дотягиваются, «вытаскивают» слабые места модели.
Нужно уточнить: эти три типа рейтингов имеют разные акценты и не взаимозаменяемы. Рейтинг на реальном железе — про выполнение, рейтинг мировых моделей — про рассуждение/планирование, специализированный — про границы возможностей. Ни один не способен охватить все способности embodied intelligence.
С такой координатной системой можно разложить по местам боевые сводки базовых моделей embodied intelligence за последние полгода. Если свести в единый отчёт боевые сводки базовых моделей за последние два месяца, получится довольно впечатляющий список.
В мае звёздная компания Era0 заявила, что заняла первое место в RoboChallenge Table30; 智元 GE-Sim 2.0 — первое место в World Arena Track1; 跨维 DSCFuncWorld — первое в World Arena Track2. В июне 千寻 Spirit v1.6 забрала первое место в RoboArena (позже её оттуда исключили), а 鹿明 Prime R0 возглавила MolmoSpaces. Почти у каждой компании есть «первое», и у каждого при этом есть конкретная позиция в конкретном рейтинге как подтверждение.
А хаос искажения как раз начинается с разных рейтингов.
Самое заметное — лидерство выглядит как «шведский стол»: «первое место» меняется очень часто.
Лидер RoboChallenge Table30 в последние полгода менялся минимум четырежды: сначала 千寻 Spirit v1.5 с успешностью 50,33% обновила рекорд, но вскоре её обошли GigaBrain-0.1 от 极佳視界, американская Boston Dynamics Atlas и звёздная компания Era0 — Star Dynamics.
Так быстро, как в этом темпе, обновляются куда чаще, чем в популярных рейтингах больших языковых моделей. В 2023–2025 годах позиции лидеров в таких таблицах, как MMLU и GSM8K, у GPT-4, Claude 3 и Gemini 1.5 обычно держались месяцами — от нескольких месяцев до года. Даже в период быстрых итераций 2020–2022 GPT-3 и PaLM менялись по циклам в основном в пределах месяцев. «Для нынешнего embodied intelligence подняться на первое место и удерживать его одной модели хотя бы неделю — уже считается непросто», — заявил Mi Fan, сотрудник одной из топовых компаний в этой сфере.
Основные причины сводят к двум пунктам. Во‑первых, случайность физического мира: один и тот же модель, если прогнать на реальном стенде дважды, вполне может показать разницу 3–5 процентных пунктов. Освещение, положение объектов, допуски механического манипулятора влияют на результат. А рейтинги больших языковых моделей типа MMLU — это фиксированные вопросы и детерминированное выставление баллов: один и тот же модель, если прогнать 100 раз, почти не меняется. Во‑вторых, степень открытости тестовых задач. Например, в RoboChallenge Table30 распределение 30 задач опубликовано; разные команды могут собрать данные под эти задания, дообучить модель и затем снова сдать. Поэтому «срок годности» позиции лидера сжимается до недель.
Самое сбивающее с толку — то, что в одном и том же рейтинге порой одновременно появляются сразу несколько «первых».
World Arena — типичный пример: 智元 GE-Sim 2.0 и 跨维 DSCFuncWorld заявляют о «победе в World Arena», но на деле у этого рейтинга несколько «треков». В Track1 (восприятие и реакция на действия) GE-Sim 2.0 набирает 68,26 балла и занимает первое место; DSCFuncWorld в Track2 (движок данных) тоже первое. Однако «первые места» относятся к разным подпроцедурам, а вовне их сводят в одну фразу.
Для читателей, которые плохо знакомы с разбиением на треки, формулировка «World Arena первое место» сразу в двух местах почти не различима. Некоторые даже подумают, что кто-то врёт. Но на самом деле никто не сказал неправду — просто формулировка недостаточно точная.
Есть и ещё более размытая зона: характер самих таблиц смешанный. При этом ценность «первого места» по умолчанию считают одинаковой категорией, что легко вводит в заблуждение.
Во внешних презентациях некоторых компаний часто одновременно фигурируют формулировки вроде «данная модель заняла первое место в RoboChallenge» и «в оценивании какого-то медиа по embodied intelligence тоже заняла первое место». Первое — это успешность, полученная при круглосуточных реальных прогонах 7×24. Второе может быть просто список, согласованный на закрытых обсуждениях редакции и даже после коммерческих договорённостей. Когда оба варианта ставят рядом в одной фразе, ценность по умолчанию почему‑то считают одной и той же категорией.
Самое размытое — это «индустриальные рейтинги»: некоторые таблицы называют себя «индустриальными», но это ни не «жёсткий» реальный бенчмарк, закреплённый за реальными стендами, ни классический benchmark, подтверждённый научными организациями. Это скорее рейтинг с баллами, который делают совместно консалтинговые компании или медиа. Похожее встречалось и в мире больших языковых моделей. Но по мере того как научные рейтинги, коммерческие оценки и медиа-рейтинг постепенно разделяются, «двойное первое» тоже постепенно разваливалось на разные категории. А embodied intelligence сейчас как раз находится в этапе, когда такое разделение ещё не завершено.
Сумма трёх явлений даёт результат: в рейтингах наблюдается жёсткая инфляция «первых мест». Причём эта «инфляция» не ограничивается уровнем маркетинга: титул «первого» часто конвертируется в внимание, ресурсы и ощутимую премию к оценке.
02 Как вообще «делают первое место»?
Раз рейтинг может «переламывать» реальные деньги, то и то, как «сделать первое место», оформилось в виде «неписаных правил». Сотрудники отрасли рассказывают: хотя у Spirit v1.6 от 千寻 это был скорее крайний единичный случай, в отрасли «делать первые места» встречается не так уж редко. Механизмы примерно трёх видов.
Самый дешёвый и самый распространённый метод — «упаковка речью»: «первое по дисциплине» превращают в «первое по общей сумме». Смысл — убрать ключевые уточняющие слова.
Например, фактически у вас «первое по RoboTwin 2.0 в задаче согласованной работы двух рук формата VLA Clean», а вовне это превращают в «заняли первое место в RoboTwin 2.0». Или фактически это «первое в специализированной задаче по обобщению сценариев LIBERO-Plus», а вовне это подают как «лидерство в рейтинге LIBERO-Plus». Данные не подделаны, результат настоящий — но диапазон того, что именно означает «первое место», искусственно расширяют.
Второй способ — вмешиваться в результат напрямую через «натаскивание» и подобные приёмы.
Один из способов — «натаскиваться по билетам». Опубликованные распределения заданий, критерии оценивания и параметры среды можно использовать для прицельных дообучений. Особенно это заметно в таблицах, где задачи относительно фиксированы: разные команды могут, многократно «решая задачи», переобучиться под конкретный сценарий и таким образом получать высокие баллы.
Mi Fan говорит: в embodied-сфере часть рейтингов имеет опубликованные тестовые задачи. Команды могут собрать данные под эти задачи, дообучить модели и затем подать результаты — в этой среде это считается нормальной итерацией и не считается мошенничеством. Это по сути отличается от в LLM-сфере «утечки данных» и «загрязнения данных».
Другая схема — искать уязвимости в механизме оценивания. Некоторые рейтинги считаются очень «авторитетными», но в механике находятся лазейки. Например, RoboArena использует открытый регистрационный доступ и распределённое оценивание. Замысел — привлечь больше участников, но в системе остались три «дыры».

Первый: личности оценщиков без порога. Любой может зарегистрироваться судьёй. За короткое время может сконцентрироваться множество новых аккаунтов, которые оценят один и тот же модель — и Elo быстро взлетит вверх.
Во‑вторых, подбор соперников не требует полного покрытия: ? случайное распределение оппонентов не означает, что нужно обязательно провести раунд против всех, кто в текущий момент в рейтинге. Когда оценщик берёт задание, A — фиксированный, а B случайно выбирают из моделей, близких по баллам. Если выборка недостаточно большая, то два модели могут вообще ни разу не встретиться. Например, в ранний период Spirit v1.6 и DreamZero провели 23 встречи, затем перемирие, и до 30 мая, когда на рейтинг зашла Nvidia Cosmos3-Nano-Policy, между ними вообще не было ни одной дуэли;
В-третьих, концентрированно «прокачивают» оценивание: используют несколько аккаунтов и интенсивно прогоняют оценивания своей модели, снижая долю негативных записей. Например, в 310 записях оценивания Spirit v1.6 72% баллов взяты с аккаунтов ECUST и Robotics Lab. Они провели 224 прогона оценивания и выбили 97% побед — и таким образом вытолкнули Spirit v1.6 на первое место. Но Nvidia при аналогичных условиях провела 21 самопроверку — и её победность оказалась 0%. Когда эти две группы данных ставят рядом, у специалистов возникают сомнения.
После этого RoboArena дополнила правила: оценщиками должны быть не имеющие заинтересованности независимые третьи стороны — так перекрыли вход для самораскачки. Аккаунты с долей завершённых оценок ниже 20% помечают как подозрительные, а также закрывают возможность «выборочного» подбора. После обработки 千寻 вылетела из списка.
Есть ещё один способ — самый скрытый и самый распространённый: обмен ресурсами, когда рейтинг фактически превращают в бизнес.
Многие медиа-рейтинги не раскрывают критерии отбора. Иногда всё совсем просто: между медиа и объектом оценки существуют бизнес‑связи. Обе стороны совместно выпускают «авторитетный отчёт», упаковывая медиа-рейтинг и научный бенчмарк бок о бок. Это не про технологии и не про данные — только про бюджеты и отношения. Несколько специалистов прямо отмечали, что явления вроде «раскачивания» рейтингов и «покупки мест» встречаются довольно часто.
Эти три приёма часто накладываются друг на друга: сначала с помощью прицельного дообучения или поиска лазеек «разгоняют» баллы, затем подменяют источник в рамках механизма отраслевых соревнований, а напоследок с помощью риторики распространяют это наружу. При необходимости — докупают медиа-рейтинг как подтверждение. При многоступенчатой упаковке «первое место» и получается само собой.
Эти приёмы внутри отрасли не секреты. Проблема в другом: чтобы распознать их, нужна определённая техническая база. Чем сложнее технологии, тем труднее внешним это отличить — а истории рассказывать становится слишком легко.
03 Убрать «воду», а чему тогда верить?
Не один специалист по embodied intelligence признаёт: сейчас они почти не следят за местами в таблицах, потому что рейтинги можно «прокачать» и «купить», и даже если всё формально соответствует правилам, сложность реальной физической среды делает данные практически невозможными на 100% точными.
Более глубокая проблема в том, что отрасль пока не имеет универсальной «линейки».
Сотрудник отрасли gashero описал это сравнением «жарить яичницу» и «мешать холодный гарнир»: робот A умеет жарить яичницу с успехом 90%, робот B умеет мешать холодный гарнир с успехом 85%, но нельзя отсюда сделать вывод, что A лучше B. Жарка яиц проверяет захват и переворот, а гарнир — точность наливания и перемешивание. Это разные навыки, разная сложность и разные критерии оценки. В нынешнем embodied intelligence пока нет единого стандарта, который бы мог пересчитать «умение жарить яичницу» и «умение мешать гарнир» в одну и ту же систему баллов.
Но это не значит, что рейтинги совсем бесполезны. Большинство специалистов считает, что у них остаётся справочная ценность: главное — знать, что именно стоит смотреть, и после просмотра ещё понимать, что нужно проверить дальше.

С учётом отраслевого консенсуса: действительно доверительный рейтинг в целом должен одновременно обладать тремя признаками.
Во‑первых, прозрачность по подпунктам: не просто бросают один ярлык «первого места».
Независимо от того, общий ли это рейтинг или специализированный, доверительный подход — разбирать подробности по пунктам. Например, RoboChallenge Table30: он измеряет комплексную успешность на 30 ежедневных задачах. Доверительность в том, что он не только сообщает читателю общий показатель 64,33%, но и показывает, какие из 30 задач сделаны хорошо, а на каких провал. Рейтинг, который сообщает только общий счёт и не показывает детализацию, теряет значительную часть ценности.
Во-вторых, оценивание контролируется третьей стороной и предусмотрены меры против «дотошного раскачивания» результата.
MolmoSpaces не допускает дообучение: модель просто «сдаёт голыми». LIBERO-Plus добавляет экстремальные возмущения — резкие изменения освещения, хаотичный фон, изменения угла камеры — чтобы специально помешать получать баллы, просто заучив. Их общий признак: усложнить «натаскивание» и сделать обобщение настоящим порогом.
Третий — смотреть не на частоту обновлений, а на сам механизм оценивания.
Рейтинги, которые обновляются медленно, не обязательно надёжны; и рейтинги, которые обновляются быстро, тоже не обязательно нельзя «раскачать». Некоторые таблицы обновляются медленно, потому что оценка на реальном железе очень дорогая: например, на RoboChallenge один полный цикл оценивания может занять недели — 30 задач, по 10 прогонов на каждую, всего 300 реальных попыток, 7×24 часа непрерывной работы. Это — ограничение «стоимости физического мира». Другие таблицы обновляются быстро из‑за механизма. Так, RoboArena использует систему Elo для динамического ранжирования: постоянно поступают новые данные по матчам, поэтому позиции обновляются каждый день. Сам по себе «быстрый» темп не проблема — вопрос в том, насколько механизм строгий и закрыты ли уязвимости.
Но раз всем в кругу известно, что в рейтингах есть «вода», почему люди всё равно так отчаянно «прокачивают»?
Ответ — в текущей стадии развития отрасли.
Сейчас эта «гонка за первыми местами» по сути — продукт тревоги капитала. В этом году базовые модели embodied intelligence проходят плотную итерацию: на раннем этапе нестабильны объёмы поставок, выручка и количество заказов. Поэтому приходится «держаться за рейтинги». Фаза, ориентированная на финансирование, не изменилась — значит, «раскачивание» рейтингов не прекратится.
Когда отрасль перейдёт к следующему этапу, критерии оценки естественно поменяются — например, сколько устройств поставляют в год, какие есть фиксированные клиенты, удаётся ли зарабатывать прибыль. Тогда инфляция «первых мест» сама собой сойдёт на нет, и рейтинги вернутся туда, где им и место.
Возможно, ответ отрасли — именно в компаниях, которые не спешат «выбивать» места в рейтингах, а просто запускают роботов на производственные линии.
(по просьбе респондента; в тексте Mi Fan — псевдоним)