#MyStrategyEvolution Nous avons découvert que les stratégies d'évolution (ES), une technique d'optimisation connue depuis des décennies, rivalisent avec la performance des techniques d'apprentissage par renforcement (RL) standard dans les benchmarks modernes de RL (par exemple, Atari/MuJoCo), tout en surmontant de nombreux inconvénients du RL.

En particulier, l'ES est plus facile à mettre en œuvre (pas besoin de rétropropagation).(s'ouvre dans une nouvelle fenêtre)), il est plus facile à mettre à l'échelle dans un environnement distribué, ne souffre pas dans des environnements avec des récompenses rares et a moins d'hyperparamètres.(s'ouvre dans une nouvelle fenêtre)Ce résultat est surprenant car l'ES ressemble à une simple ascension de collines dans un espace de haute dimension basé uniquement sur des différences finies.(s'ouvre dans une nouvelle fenêtre) le long de quelques directions aléatoires à chaque étape.

Notre découverte poursuit la tendance moderne à obtenir des résultats solides avec des idées datant de plusieurs décennies. Par exemple, en 2012, l'article "AlexNet "(s'ouvre dans une nouvelle fenêtre) a démontré comment concevoir, mettre à l'échelle et entraîner des réseaux de neurones convolutifs (CNN) pour obtenir des résultats exceptionnellement solides dans des tâches de reconnaissance d'images, à un moment où la plupart des chercheurs pensaient que les CNN n'étaient pas une approche prometteuse pour la vision par ordinateur. De même, en 2013, l'article sur l'apprentissage profond Q ...(s'ouvre dans une nouvelle fenêtre) a montré comment combiner Q-Learning avec des CNN pour résoudre avec succès des jeux d'Atari, revitalisant l'apprentissage automatique (RL) en tant que domaine de recherche avec des résultats expérimentaux passionnants (plutôt que théoriques). De plus, notre travail démontre que l'ES obtient d'excellentes performances dans les tests de référence de RL, dissipant la croyance commune selon laquelle les méthodes d'ES sont impossibles à appliquer à des problèmes de haute dimension.