Message IA ME, aperçu Beating AI, informations rapides : après la sortie de MiMo-V2.6, la responsable de MiMo chez Xiaomi, Luo Fuli, a expliqué plus en détail cette vague d’apprentissage par renforcement. Elle affirme qu’elle a elle-même participé à DeepSeek R1, et que, selon elle, les innovations de recherche et les défis d’ingénierie derrière MiMo-V2.6 dépassent déjà R1. Elle explique aussi pourquoi MiMo utilise à la fois MixRL et MOPD : MixRL mélange dans une même boucle d’apprentissage par renforcement du code, des agents généralistes, la vision et des tâches vérifiables liées à la sécurité informatique, afin de les entraîner ensemble ; tandis que MOPD est chargé de gérer des tâches très longues, difficiles à vérifier ou dont la récompense est plus subjective. Ces tâches sont d’abord entraînées séparément, puis les capacités apprises sont intégrées au modèle principal. Pour des tâches comme les jeux ou la 3D, le temps d’exécution est trop long et il est difficile d’évaluer automatiquement ce qui est bon ou faux. Si on les regroupe avec d’autres tâches, comme le code, dans la même boucle RL, l’entraînement sera nettement ralenti. MiMo entraîne donc ce type de tâches séparément, puis réintègre les capacités apprises dans le modèle principal via MOPD. (Source : ME)
