Tác giả | Dingjiao One? Wang Lu

Biên tập | Wei Jia

Khi lĩnh vực trí tuệ thể hiện (具身智能) tiếp tục thu hút sự chú ý của các dòng vốn, thì ngày càng nhiều bảng xếp hạng liên quan cũng ra đời. Khi “ngôi đầu tiên” gần như trở thành tiêu chuẩn của mọi bên, thì các bảng xếp hạng còn đáng tin đến đâu?

Hơn một tháng trước, Qianxun Intelligence đã trải qua một khoảnh khắc lúng túng. Đầu tháng 6, mô hình nền tảng thể hiện (具身基座) Spirit v1.6 của công ty trên bảng xếp hạng RoboArena đạt 1918 điểm, vượt qua 1880 điểm của Nvidia Cosmos3, từng tạm thời đứng đầu với vị trí “số 1 thế giới”. Ngay sau đó, Qianxun công bố hoàn tất vòng A+ trị giá 1,5 tỷ nhân dân tệ; trong vòng ba tháng, công ty đã liên tục hoàn tất bốn vòng tài trợ dày đặc, tổng giá trị gần 5 tỷ nhân dân tệ, thiết lập kỷ lục tần suất tài trợ mới cao nhất trong lĩnh vực trí tuệ thể hiện.

Tuy nhiên, trong giới lại gần như ngay từ ngày hôm sau những nghi ngờ về chất lượng dữ liệu đánh giá đã bắt đầu nóng lên. Một người quan sát cho biết, trong 310 lượt ghi nhận đánh giá, 72% số điểm đến từ hai tài khoản. Điều đáng chú ý hơn là sau đó, trang RoboArena chính thức công bố tuyên bố: sau khi lần theo điều tra, họ đã loại bỏ một phần dữ liệu đánh giá còn nghi vấn và cập nhật thứ hạng trên bảng. Spirit v1.6 cũng theo đó bị xóa khỏi bảng xếp hạng.

Nhưng sự kiện này không dập tắt nhiệt tình của người chơi. Mở các tin tức của ngành trong gần nửa năm qua ra, có thể thấy gần như công ty đầu lĩnh nào cũng nắm trong tay một “số 1”, và các “số 1” đó lại không giống nhau theo từng chiều cạnh.

Cảnh tượng này có lẽ không khó để hiểu: hiện nay lộ trình công nghệ của trí tuệ thể (具身智能) vẫn chưa thống nhất, tỷ lệ thành công khi chạy thật (trên phần cứng) đa số kẹt ở mức năm đến sáu phần trăm. Khi bên ngoài muốn biết một công ty rốt cuộc có “được” hay không, thì phần lớn chỉ có thể dựa vào bảng xếp hạng. Nhưng khi đơn vị công bố không chỉ có trường đại học, tổ chức mà còn có cả truyền thông, và chuẩn mực của mỗi bên lại khác nhau, thậm chí còn dính đơn hàng và quan hệ lợi ích—thì bảng xếp hạng liệu còn có thể làm “thước đo” nữa hay không là một câu hỏi.

Một nhà đầu tư quan tâm tới mảng trí tuệ thể cho biết: bảng xếp hạng nghiêng về hành vi thị trường nhiều hơn, nhiều nhất chỉ là một tham chiếu cho quyết định đầu tư. Ông ấy không hề ngạc nhiên về chuyện của Qianxun. Theo ông, những nơi thật sự để ý thứ hạng thường không phải là các tổ chức xuất phát từ tài chính hay kỹ thuật, mà là một số quỹ dẫn dắt tại địa phương hoặc các nguồn vốn thiên về quốc hữu. Một “số 1” có thể chính là “cửa vào tốt” mà họ viết vào báo cáo. Nhưng cũng có nhà đầu tư có quan điểm khác: họ cho rằng ở giai đoạn đầu của mảng có ngưỡng kỹ thuật cao và bất cân xứng thông tin, thì ít nhất bảng xếp hạng cũng cung cấp một điểm khởi đầu để so sánh ngang hàng theo chiều ngang.

Khi số lượng “số 1” nhiều hơn cả những công ty nghiêm túc làm robot, thì các bảng này rốt cuộc là đang đo công nghệ, hay đo năng lực “kể chuyện”? Những bảng nào còn đáng xem?

01 Lộ trình công nghệ còn chưa thống nhất, trước tiên ai cũng có “một số 1”

Trước hết, chúng ta hãy xem xét các bảng xếp hạng đang có trên thị trường hiện nay, để xây dựng một ấn tượng tổng quát. Theo thống kê chưa đầy đủ, hiện nay có tới hơn 20 bảng xếp hạng hoạt động dành cho trí tuệ thể. Xét theo nội dung đánh giá, các bảng này đại thể có thể chia thành ba loại.

Bảng tổng hợp thao tác VLA (VLA operation综合榜) đánh giá robot có thực sự làm được việc không: chạy theo tỷ lệ thành công của nhiệm vụ. Đại diện là RoboChallenge Table30 và MolmoSpaces;

Bảng mô hình thế giới (world model) kiểm tra xem việc suy luận trong đầu có đúng không: đánh giá khả năng suy diễn của mô hình đối với thế giới vật lý, không kiểm tra tay chân của robot có gọn gàng, nhanh nhẹn hay không. Đại diện là World Arena và WorldModelBench;

Bảng chuẩn chuyên biệt (专项基准榜) kiểm tra “có bị lộ trong tình huống cực đoan hay không”, nhắm vào năng lực cực đoan tại một điểm đơn lẻ, chẳng hạn như phối hợp hai cánh tay, hoặc chuyển từ mô phỏng sang phần cứng (sim-to-real). Đại diện là RoboTwin 2.0, SimplerEnv, LIBERO và CALVIN. Giá trị của nó nằm ở chỗ, trong các tình huống cực đoan mà bảng tổng hợp không bao phủ, buộc các điểm yếu của mô hình phải lộ ra.

Cần nói rõ rằng: ba loại bảng xếp hạng này mỗi loại có trọng tâm riêng, không thể thay thế cho nhau. Bảng phần cứng thật đo hành vi, bảng mô hình thế giới đo suy diễn, bảng chuẩn chuyên biệt đo ranh giới. Không bảng nào bao phủ được toàn bộ năng lực của trí tuệ thể.

Có mốc tọa độ này, thì có thể “xếp chồng” các bản tin chiến báo của gần nửa năm về mô hình nền tảng trí tuệ thể vào đúng vị trí. Nếu tổng hợp các chiến báo của hai tháng gần đây về mô hình nền tảng trí tuệ thể, có thể thu được một danh sách khá ấn tượng.

Vào tháng 5 năm nay, Xingdong Jiyuan Era0 tuyên bố giành vị trí số 1 RoboChallenge Table30; Zhiton GE-Sim 2.0 là số 1 World Arena Track1; còn Kuawen (跨维) DSCFuncWorld là số 1 World Arena Track2. Sang tháng 6, Qianxun Spirit v1.6 giành RoboArena số 1 (sau đó bị loại khỏi bảng), và Lu Ming Prime R0 leo lên đầu MolmoSpaces. Gần như công ty nào cũng là số 1, và đều có bảng xếp hạng cụ thể làm bằng chứng hậu thuẫn.

Và sự hỗn loạn cũng xuất phát từ đủ loại bảng xếp hạng.

Rõ ràng nhất là: vị trí quán quân giống như “mâm cỗ bày liên tục”, “số 1” thay đổi rất thường xuyên.

Đứng đầu bảng của RoboChallenge Table30, trong nửa năm qua ít nhất đã thay đổi bốn lần: đầu tiên là Qianxun Spirit v1.5 với tỷ lệ thành công 50.33% đã phá kỷ lục; rất nhanh sau đó lại bị GigaBrain-0.1 của Jiajian Shijie, Atlas của Boston Dynamics (Mỹ) và Era0 của Xingdong Jiyuan lần lượt vượt qua.

Tốc độ này nhanh hơn nhiều so với các bảng xếp hạng chính thống của mô hình ngôn ngữ lớn. Từ 2023 đến 2025, vị trí số 1 của GPT-4, Claude 3 và Gemini 1.5 trên các bảng như MMLU, GSM8K thường có thể giữ trong vài tháng đến cả một năm. Dù trong giai đoạn lặp nhanh 2020 đến 2022, GPT-3 và PaLM cũng thay bảng theo chu kỳ tính theo tháng. “Với trí tuệ thể hiện nay, một mô hình thống trị bảng trong một tuần thôi cũng đã là không dễ dàng.” Một người trong công ty đầu lĩnh về trí tuệ thể tên Mi Fan nói.

Nguyên nhân chính có thể quy về hai điểm. Một là tính ngẫu nhiên của thế giới vật lý: cùng một mô hình chạy hai lần trên phần cứng thực thì sự chênh lệch tỷ lệ thành công 3 đến 5 điểm phần trăm là bình thường. Ánh sáng, vị trí vật thể, dung sai tay máy đều ảnh hưởng kết quả. Trong khi đó, các bảng xếp hạng của mô hình ngôn ngữ lớn như MMLU là đề cố định, chấm điểm mang tính quyết định (deterministic), nên cùng một mô hình chạy 100 lần thì điểm gần như không đổi. Hai là mức độ công khai của nhiệm vụ thử nghiệm: như Table30 của RoboChallenge, phân bố của 30 nhiệm vụ này là công khai. Các bên có thể căn theo đó thu thập dữ liệu chuyên cho từng nhiệm vụ, tinh chỉnh mô hình rồi nộp lại. Vì vậy “thời hạn chất lượng” của vị trí quán quân bị rút xuống tính theo tuần.

Điều gây khó hiểu hơn nữa là: trong cùng một bảng, có thể đồng thời xuất hiện nhiều “số 1”.

World Arena là một ví dụ điển hình: Zhiton GE-Sim 2.0 và Kuawen DSCFuncWorld khi ra bên ngoài đều tự gọi là “đứng đầu World Arena”. Nhưng thực tế là bảng này có nhiều đường đua (track). Zhiton GE-Sim 2.0 đứng đầu ở Track1 (cảm nhận và phản hồi hành động) với 68.26 điểm; còn Kuawen DSCFuncWorld đứng đầu ở Track2 (engine dữ liệu). “Số 1” thuộc các bảng con khác nhau, nhưng ra bên ngoài lại bị gom lại thành đúng một câu nói.

Đối với những độc giả chưa quen với việc phân chia mảng, cách nói “World Arena cùng đứng đầu” của hai bên gần như không thể phân biệt; thậm chí họ có thể nghi ngờ có người đang nói dối. Nhưng thật ra không ai nói sai—chỉ là không đủ chính xác.

Còn một vùng mờ khác là: tính chất của bảng xếp hạng bị trộn lẫn, nhưng giá trị của “số 1” lại mặc định được coi như cùng một “hạng”. Điều này rất dễ gây hiểu lầm.

Trong cách nói ra bên ngoài của một số công ty, họ thường đồng thời liệt kê “một mô hình nào đó đứng số 1 trên RoboChallenge”, và “trong một đợt đánh giá của truyền thông trí tuệ thể cũng đứng số 1”. Cái thứ nhất là tỷ lệ thành công rút ra từ chạy thật 24/7 trên phần cứng; cái thứ hai có thể chỉ là danh sách do ban biên tập thảo luận kín, thậm chí do chốt theo hợp tác thương mại. Hai thứ được đặt cạnh nhau trong một câu, nhưng giá trị lại bị mặc định là cùng một “hạng”.

Trong đó mơ hồ nhất là “bảng theo ngành” (产业榜). Có những bảng lấy danh nghĩa “ngành” nhưng không phải là bảng phần cứng bị khóa chặt bằng chạy thật, cũng không phải benchmark có tổ chức học thuật đứng ra bảo chứng. Thay vào đó là bảng chấm điểm do công ty tư vấn hoặc truyền thông hợp tác tổ chức. Những trường hợp tương tự cũng từng xuất hiện trong cộng đồng mô hình ngôn ngữ lớn, nhưng khi bảng học thuật, đánh giá thương mại và bảng truyền thông dần được tách lớp (phân tầng), thì “kép số 1” mới dần bị bóc tách. Còn trí tuệ thể hiện nay thì vẫn đang ở giai đoạn chưa phân tầng đó.

Ba hiện tượng chồng lên nhau thì kết quả là bảng xếp hạng “số 1” bị lạm phát nghiêm trọng. Hơn nữa, sự lạm phát này không chỉ dừng ở lớp marketing: một danh hiệu “số 1” thường có thể đổi lấy mức độ chú ý, nguồn lực và thậm chí là phần chênh lệch định giá thực sự.

02 Một “số 1” được tạo ra như thế nào?

Vì bảng xếp hạng có thể “lay chuyển” cả tiền bạc thật, nên làm thế nào để tạo ra “số 1” cũng dần hình thành “luật ngầm”. Một người trong ngành cho biết, dù Spirit v1.6 của Qianxun thuộc trường hợp cực đoan, nhưng hiện tượng tạo “số 1” trong ngành không hề hiếm. Có thể tóm lại thành khoảng ba cách.

Cách phổ biến và chi phí thấp nhất là “đóng gói bằng lời thoại”: “số 1 theo từng môn” được biến thành “tổng điểm số 1”. Mấu chốt là cắt bỏ các từ/cụm giới hạn quan trọng.

Ví dụ thực tế lấy là “RoboTwin 2.0 phối hợp hai cánh tay VLA dạng Clean—đứng đầu”, nhưng ra bên ngoài lại biến thành “đứng đầu RoboTwin 2.0”. Thực tế là “đứng đầu chuyên hạng bao quát kịch bản LIBERO-Plus”, nhưng đối ngoại lại thành “đứng đầu bảng LIBERO-Plus”. Không có gian lận dữ liệu, thành tích cũng là thật, nhưng phạm vi mà “số 1” đó đại diện lại bị cố ý phóng đại.

Cách thứ hai là lợi dụng “cày đề” để can thiệp trực tiếp vào kết quả.

Một câu là “luyện theo đề thi”. Các phân bố nhiệm vụ, tiêu chí chấm điểm và thông số môi trường mà bảng xếp hạng công khai đều có thể được dùng để huấn luyện có nhắm mục tiêu. Ở một số nhiệm vụ trên bảng vốn tương đối cố định, điều này thể hiện đặc biệt rõ: các bên có thể lặp đi lặp lại “luyện đề”, rồi quá khớp (overfit) vào một bối cảnh cụ thể để đổi lấy điểm cao.

Mi Fan cho biết: một phần các bảng trong lĩnh vực trí tuệ thể có nhiệm vụ đánh giá công khai. Các công ty có thể thu thập dữ liệu chuyên cho những nhiệm vụ đó, tinh chỉnh mô hình rồi nộp lại. Ở giới trí tuệ thể, điều này được xem là quy trình lặp bình thường, không tính là gian lận. Nó khác bản chất với “rò rỉ dữ liệu, nhiễm bẩn dữ liệu” trong lĩnh vực LLM.

Một hướng khác là “đục khoét” lỗ hổng trong cơ chế đánh giá. Một số bảng có mức độ “uy tín” rất cao nhưng lại có thể bị lợi dụng. Ví dụ RoboArena dùng đăng ký mở, đánh giá phân tán—ý định ban đầu là để nhiều người tham gia hơn, nhưng lại để lại ba lối hở.

Thứ nhất là danh tính người đánh giá không có rào cản. Bất kỳ ai cũng có thể đăng ký làm trọng tài. Chỉ cần trong thời gian ngắn nhiều tài khoản mới tập trung đánh giá cùng một mô hình thì có thể đẩy điểm Elo của mô hình lên nhanh chóng;

Thứ hai là không ép đối sánh phải bao phủ hết: ? phân phối ngẫu nhiên đối thủ không có nghĩa là buộc phải đấu một vòng với tất cả những kẻ đang nằm trong bảng cùng kỳ. Khi người đánh giá nhận nhiệm vụ, A là cố định; còn B được rút ngẫu nhiên từ các mô hình có điểm tương đương. Nếu cỡ mẫu không đủ lớn thì hai mô hình hoàn toàn có thể không gặp nhau lần nào. Ví dụ như Spirit v1.6 giai đoạn đầu đối đầu với DreamZero: sau 23 trận thì ngừng, còn Nvidia Cosmos3-Nano-Policy vào bảng từ ngày 30/5 thì bằng không đối đầu.

Thứ ba là tập trung cày đánh giá: dùng nhiều tài khoản để liên tục đánh giá mô hình của chính mình, nhằm hạ thấp các ghi nhận tiêu cực. Ví dụ trong 310 lượt đánh giá của Spirit v1.6, 72% điểm đến từ hai tài khoản ECUST và Robotics Lab. Họ dùng 224 lượt đánh giá để đạt tỷ lệ thắng 97%, đẩy Spirit v1.6 lên vị trí số 1. Nhưng Nvidia lại tự đo bằng cùng điều kiện 21 lần, tỷ lệ thắng 0%. Đặt hai bộ dữ liệu cạnh nhau thì khiến người trong ngành sinh nghi.

Sau đó, RoboArena bổ sung quy tắc: người đánh giá phải là bên thứ ba không có liên quan lợi ích; chặn lối vào cho tài khoản tự cày. Những tài khoản có tỷ lệ hoàn thành đánh giá dưới 20% được đánh dấu là đáng ngờ; chặn việc bắt đúng đối tượng theo lựa chọn. Sau xử lý, Qianxun rơi khỏi bảng xếp hạng.

Một cách khác còn ẩn蔽 và phổ biến nhất là trao đổi nguồn lực, biến bảng xếp hạng trực tiếp thành một “dịch vụ kinh doanh”.

Nhiều bảng xếp hạng theo truyền thông không minh bạch tiêu chí bình chọn. Có nơi thậm chí thẳng tay có hợp tác kinh doanh với đối tượng được vinh danh: hai bên liên kết phát hành một “báo cáo uy tín”, đóng gói bảng của truyền thông và benchmark học thuật vào cùng một bộ. Nó không liên quan công nghệ, cũng không liên quan dữ liệu—chỉ liên quan ngân sách và quan hệ. Không ít người trong ngành cho biết các hiện tượng như “cày bảng”, “mua bảng” không hề hiếm.

Ba kiểu làm này thường chồng lên nhau: đầu tiên dựa vào huấn luyện có chủ đích hoặc chui lỗ hổng để cày điểm lên; sau đó dùng việc tráo đổi theo “đường đua” để che giấu nguồn gốc; cuối cùng dùng chiêu truyền thông bằng lời thoại để phổ biến ra bên ngoài, khi cần thiết thì lại mua một bảng xếp hạng từ truyền thông để làm “bằng chứng”. Qua từng lớp đóng gói như vậy, “số 1” trở thành tất cả.

Những chiêu thức này trong nội bộ ngành không phải là bí mật. Vấn đề thật nằm ở chỗ: nhìn thấu chúng cần một nền tảng kỹ thuật nhất định. Kỹ thuật càng phức tạp thì người ngoài càng khó phân biệt; còn câu chuyện thì càng dễ “kể”.

03 Loại bỏ “nước” rồi thì còn nên tin gì?

Không ít người làm trong trí tuệ thể thừa nhận rằng hiện tại họ đã không còn quá quan tâm đến thứ hạng bảng, vì bảng có thể bị cày hoặc mua. Dù mọi thứ có thể đều hợp quy, thì độ phức tạp của môi trường vật lý cũng khiến dữ liệu rất khó đạt độ chính xác 100%.

Vấn đề sâu hơn là: hiện tại ngành này vẫn chưa có một “thước đo phổ dụng”.

Một người làm trong trí tuệ thể tên gashero dùng phép ví von “chiên trứng” và “trộn đồ ăn nguội”. Robot A giỏi chiên trứng, tỷ lệ thành công 90%; robot B giỏi trộn đồ ăn nguội, tỷ lệ 85%. Nhưng không thể vì thế mà nói A mạnh hơn B. Chiên trứng đòi hỏi khả năng gắp và đảo chảo; trộn đồ ăn nguội đòi hỏi rót chính xác và khuấy đều. Hai việc là hai kỹ năng khác nhau, độ khó khác nhau, và tiêu chí đánh giá cũng khác nhau. Hiện tại mảng trí tuệ thể vẫn chưa có một chuẩn thống nhất có thể quy đổi “năng lực chiên trứng” và “năng lực trộn đồ ăn nguội” vào cùng một hệ thống chấm điểm.

Nhưng điều đó không có nghĩa là bảng xếp hạng hoàn toàn vô nghĩa. Những người làm trong ngành nhìn chung cho rằng bảng vẫn có giá trị tham khảo. Điều then chốt là biết cái nào đáng xem, và sau khi xem xong còn cần tiếp tục nhìn gì.

Theo nhận thức chung trong ngành, một bảng xếp hạng thực sự đáng tin nhìn chung đồng thời có ba đặc điểm.

Thứ nhất là minh bạch theo từng hạng mục, không phải chỉ ném ra một “số 1”.

Dù là bảng tổng hợp hay bảng chuyên biệt, cách làm đáng tin là tách chi tiết từng hạng mục. Lấy RoboChallenge Table30 làm ví dụ: nó đo tỷ lệ thành công tổng hợp của 30 nhiệm vụ hằng ngày. Tính đáng tin nằm ở chỗ: không chỉ cho người đọc biết con số tổng hợp 64.33%, mà còn chỉ rõ trong 30 nhiệm vụ đó nhiệm vụ nào làm tốt, nhiệm vụ nào bị tụt. Những bảng chỉ báo tổng điểm mà không công bố chi tiết thì giá trị bị giảm mạnh.

Thứ hai là việc đánh giá do bên thứ ba nắm giữ, đồng thời có thiết kế chống “phản cày đề”.

MolmoSpaces không cho phép tinh chỉnh (fine-tune), mô hình chỉ được “làm bài trực tiếp” (bare test); còn LIBERO-Plus bổ sung các nhiễu cực đoan như đột biến ánh sáng, nền lộn xộn, thay đổi góc camera… nhằm ngăn chặn việc chỉ cần học thuộc mà lấy điểm. Điểm chung của chúng là làm việc “cày đề” trở nên khó hơn, và biến khả năng tổng quát hóa thành ngưỡng thật sự.

Thứ ba là xem cơ chế đánh giá, chứ không phải nhìn tần suất cập nhật.

Bảng nào cập nhật chậm thì không nhất định đáng tin; bảng cập nhật nhanh cũng không hẳn không thể bị “cày”. Có những bảng cập nhật chậm vì chi phí đánh giá phần cứng thực rất cao: ví dụ một chu kỳ đánh giá hoàn chỉnh của RoboChallenge có thể mất vài tuần. Mỗi trong 30 nhiệm vụ chạy 10 lần, tổng cộng 300 lần thử nghiệm bằng phần cứng thật, chạy liên tục 24/7 trong 7×24 giờ—đó là ràng buộc chi phí của thế giới vật lý. Còn có những bảng cập nhật nhanh là do cơ chế thiết kế. Chẳng hạn RoboArena dùng hệ thống điểm Elo để xếp hạng động: mỗi ngày lại có dữ liệu đối kháng mới vào, nên thứ hạng tự nhiên cập nhật hằng ngày. Bản thân việc “nhanh” không phải vấn đề; độ tin cậy của nó phụ thuộc vào cơ chế có chặt chẽ không và các lỗ hổng có được vá kịp không.

Nhưng nếu ai trong giới cũng biết bảng xếp hạng có “nước” (thổi phồng), vì sao mọi người vẫn liều mình cày?

Câu trả lời nằm ở giai đoạn mà ngành đang ở thời điểm hiện tại.

Cuộc tranh giành “số 1” lúc này về bản chất là sản phẩm của sự lo âu của vốn đầu tư. Năm nay là năm các mô hình nền tảng cho trí tuệ thể được cập nhật dày đặc. Lượng hàng xuất xưởng, doanh thu, số lượng đơn hàng ở giai đoạn đầu thì không ổn định, nên chỉ có thể “lấy bảng xếp hạng làm trụ”. Giai đoạn định hướng huy động vốn vẫn không đổi, thì chuyện cày bảng sẽ không dừng lại.

Khi ngành bước sang giai đoạn tiếp theo, thước đo đánh giá sẽ tự động chuyển đổi. Ví dụ: mỗi năm giao được bao nhiêu máy, có những khách hàng cố định nào, liệu có tạo lợi nhuận không. Khi đó, lạm phát của “số 1” sẽ tự nhiên lắng xuống, và bảng xếp hạng sẽ trở lại đúng vị trí mà nó vốn nên có.

Có lẽ, những công ty không vội “cày” bảng xếp hạng, chỉ tập trung đưa robot vào dây chuyền sản xuất, mới chính là câu trả lời thật sự của ngành.

(Theo yêu cầu của người được phỏng vấn, “Mi Fan” là bút danh)