オープン
#axis ベンチマークを紹介します。ロボット・マニピュレーション・モデルを正直に評価するための、ライブ(生きた)ベンチマーク・エンジンです。@openroboto と共同で開発しました。
#OpenRobotics ロボットモデルは毎月のように進化している一方で、ほとんどのベンチマークは固定されたままです。モデルは固定されたタスクセットに過適合し、スコアは実際の汎化(generalization)を反映しなくなります。そしてその歪んだシグナルは、誤った方向へモデルの進化を導き、足を引っ張ります。
Open Axis Benchmark は単に「より大規模」なだけではありません。評価そのものがモデルに歩調を合わせ続けられるようにします。各ラウンドでは、増え続ける Axis Library から新しいタスクセットを抽出して固定するため、モデルはテストを“記憶する”のではなく“汎化できる”ことを証明できます。
Axis はその背後にあるデータ・エンジンを提供しており、汎化を本当に検証するために必要な規模と多様性でタスクを継続的に生成します。Open Axis Benchmark では、ロボットを訓練するのと同じ“複利的な”ループが、評価の仕組みも動かします。
モデルを提出してください:openroboto.ai
Docs:openroboto.ai/#/docs