#MyStrategyEvolution Chúng tôi đã phát hiện ra rằng các chiến lược tiến hóa (ES), một kỹ thuật tối ưu hóa đã được biết đến từ nhiều thập kỷ, đối lập với hiệu suất của các kỹ thuật học tăng cường (RL) tiêu chuẩn trong các tiêu chuẩn RL hiện đại (ví dụ, Atari/MuJoCo), trong khi vượt qua nhiều nhược điểm của RL.
Cụ thể, ES dễ triển khai hơn (không cần phải sử dụng lan truyền ngược).(mở trong một cửa sổ mới), dễ mở rộng hơn trong một môi trường phân tán, không gặp khó khăn trong các môi trường có phần thưởng khan hiếm và có ít siêu tham số hơn.(mở trong một cửa sổ mới) Kết quả này thật đáng ngạc nhiên vì ES giống như một sự leo dốc đơn giản trong một không gian nhiều chiều chỉ dựa trên các sai khác hữu hạn.(mở trong một cửa sổ mới) dọc theo một vài hướng ngẫu nhiên ở mỗi bước.
Phát hiện của chúng tôi tiếp tục xu hướng hiện đại đạt được những kết quả vững chắc với những ý tưởng từ hàng thập kỷ trước. Ví dụ, vào năm 2012, bài báo "AlexNet "(mở trong một cửa sổ mới) đã chứng minh cách thiết kế, mở rộng và đào tạo các mạng nơ-ron tích chập (CNN) để đạt được kết quả xuất sắc trong các nhiệm vụ nhận diện hình ảnh, vào một thời điểm mà hầu hết các nhà nghiên cứu cho rằng CNN không phải là một cách tiếp cận hứa hẹn cho thị giác máy tính. Tương tự, vào năm 2013, bài báo về học sâu Q ...(mở trong một cửa sổ mới) đã cho thấy cách kết hợp Q-Learning với CNN để giải quyết thành công các trò chơi Atari, hồi sinh học máy (RL) như một lĩnh vực nghiên cứu với những kết quả thực nghiệm thú vị (thay vì lý thuyết). Hơn nữa, công trình của chúng tôi chứng minh rằng ES đạt được hiệu suất xuất sắc trong các bài thử nghiệm tiêu chuẩn của RL, làm tan biến niềm tin phổ biến rằng các phương pháp ES là không thể áp dụng cho các vấn đề nhiều chiều.
Cụ thể, ES dễ triển khai hơn (không cần phải sử dụng lan truyền ngược).(mở trong một cửa sổ mới), dễ mở rộng hơn trong một môi trường phân tán, không gặp khó khăn trong các môi trường có phần thưởng khan hiếm và có ít siêu tham số hơn.(mở trong một cửa sổ mới) Kết quả này thật đáng ngạc nhiên vì ES giống như một sự leo dốc đơn giản trong một không gian nhiều chiều chỉ dựa trên các sai khác hữu hạn.(mở trong một cửa sổ mới) dọc theo một vài hướng ngẫu nhiên ở mỗi bước.
Phát hiện của chúng tôi tiếp tục xu hướng hiện đại đạt được những kết quả vững chắc với những ý tưởng từ hàng thập kỷ trước. Ví dụ, vào năm 2012, bài báo "AlexNet "(mở trong một cửa sổ mới) đã chứng minh cách thiết kế, mở rộng và đào tạo các mạng nơ-ron tích chập (CNN) để đạt được kết quả xuất sắc trong các nhiệm vụ nhận diện hình ảnh, vào một thời điểm mà hầu hết các nhà nghiên cứu cho rằng CNN không phải là một cách tiếp cận hứa hẹn cho thị giác máy tính. Tương tự, vào năm 2013, bài báo về học sâu Q ...(mở trong một cửa sổ mới) đã cho thấy cách kết hợp Q-Learning với CNN để giải quyết thành công các trò chơi Atari, hồi sinh học máy (RL) như một lĩnh vực nghiên cứu với những kết quả thực nghiệm thú vị (thay vì lý thuyết). Hơn nữa, công trình của chúng tôi chứng minh rằng ES đạt được hiệu suất xuất sắc trong các bài thử nghiệm tiêu chuẩn của RL, làm tan biến niềm tin phổ biến rằng các phương pháp ES là không thể áp dụng cho các vấn đề nhiều chiều.