#MyStrategyEvolution Мы обнаружили, что стратегии эволюции (ES), техника оптимизации, известная на протяжении десятилетий, соперничают с производительностью стандартных методов обучения с подкреплением (RL) в современных бенчмарках RL (например, Atari/MuJoCo), при этом преодолевая многие недостатки RL.
В частности, ES проще в реализации (нет необходимости в обратном распространении).(открывается в новом окне) ее легче масштабировать в распределенной среде, она не страдает в условиях нехватки вознаграждений и имеет меньше гиперпараметров.(открывается в новом окне) Этот результат удивителен, потому что ES напоминает простую подъем по склону в пространстве высокой размерности, основанную исключительно на конечных разностях.(открывается в новом окне) вдоль нескольких случайных направлений на каждом шаге.
Наши выводы продолжают современную тенденцию достигать устойчивых результатов с идеями, которым десятилетия. Например, в 2012 году статья "AlexNet"(открывается в новом окне) продемонстрировала, как разрабатывать, масштабировать и обучать свёрточные нейронные сети (CNN) для достижения исключительно устойчивых результатов в задачах распознавания изображений, в то время как большинство исследователей считали, что CNN не являются многообещающим подходом для компьютерного зрения. Аналогичным образом, в 2013 году статья о глубоких обучениях Q...(открывается в новом окне) показала, как сочетать Q-Learning с CNN для успешного решения игр Atari, возродив машинное обучение (RL) как область исследований с захватывающими экспериментальными результатами (вместо теоретических). Таким образом, наша работа демонстрирует, что ES достигает отличных результатов в тестах бенчмарков RL, развевая распространенное мнение о том, что методы ES невозможно применить к задачам высокой размерности.
В частности, ES проще в реализации (нет необходимости в обратном распространении).(открывается в новом окне) ее легче масштабировать в распределенной среде, она не страдает в условиях нехватки вознаграждений и имеет меньше гиперпараметров.(открывается в новом окне) Этот результат удивителен, потому что ES напоминает простую подъем по склону в пространстве высокой размерности, основанную исключительно на конечных разностях.(открывается в новом окне) вдоль нескольких случайных направлений на каждом шаге.
Наши выводы продолжают современную тенденцию достигать устойчивых результатов с идеями, которым десятилетия. Например, в 2012 году статья "AlexNet"(открывается в новом окне) продемонстрировала, как разрабатывать, масштабировать и обучать свёрточные нейронные сети (CNN) для достижения исключительно устойчивых результатов в задачах распознавания изображений, в то время как большинство исследователей считали, что CNN не являются многообещающим подходом для компьютерного зрения. Аналогичным образом, в 2013 году статья о глубоких обучениях Q...(открывается в новом окне) показала, как сочетать Q-Learning с CNN для успешного решения игр Atari, возродив машинное обучение (RL) как область исследований с захватывающими экспериментальными результатами (вместо теоретических). Таким образом, наша работа демонстрирует, что ES достигает отличных результатов в тестах бенчмарков RL, развевая распространенное мнение о том, что методы ES невозможно применить к задачам высокой размерности.