Представляем живой бенчмарк-движок Open
#axis Benchmark для честной оценки моделей роботизированного манипулирования, созданный вместе с @openroboto .
#OpenRobotics Робототехнические модели развиваются быстрее каждый месяц, а большинство бенчмарков остаются неизменными. Модели переобучаются на фиксированных наборах задач, результаты перестают отражать реальную способность к обобщению, и этот искажённый сигнал вводит в заблуждение и сдерживает развитие моделей.
Open Axis Benchmark — это не просто больше. Он позволяет самой оценке идти в ногу с моделями: каждый раунд фиксирует новый набор задач, выбранный из растущей Axis Library, чтобы модели доказывали способность к обобщению, а не просто запоминали тест.
Axis обеспечивает лежащий в основе дата-движок, непрерывно генерируя задачи в масштабе и разнообразии, необходимых для действительно проверки обобщения. С Open Axis Benchmark тот же накапливающий цикл, который обучает роботов, также приводит в действие процесс их оценки.
Отправьте свою модель: openroboto.ai
Документация: openroboto.ai/#/docs