推出 Open
#axis Benchmark:一種用於誠實評估機器人操作模型的“活體基準”引擎,由 @openroboto 一同打造。
#OpenRobotics 機器人模型每個月都在更快進化,而大多數基準卻保持不變。模型會對固定任務集合過擬合,分數不再反映真實的泛化能力,而這種扭曲信號會誤導並阻礙模型的發展。
Open Axis Benchmark 不只是更大規模。它讓評估本身能夠跟上模型的進度:每一輪都會鎖定一組從不斷擴充的 Axis Library 中抽取的全新任務集,因此模型需要證明自己具備泛化能力,而不是僅僅記住測試內容。
Axis 提供其背後的數據引擎,持續以所需的規模與多樣性生成任務,以真正檢驗泛化能力。藉助 Open Axis Benchmark,用於訓練機器人的同一“複利式”循環也爲模型的評估提供動力。
提交你的模型:openroboto.ai
文檔:openroboto.ai/#/docs