Mensaje de IA de ME: Conocer las últimas noticias de Beating AI. Después de la publicación de MiMo-V2.6, la responsable de MiMo en Xiaomi, Luo Fuli, explicó con más detalle esta ronda de aprendizaje por refuerzo. Dijo que ella había participado en DeepSeek R1 y que, en su opinión, las innovaciones de investigación y los desafíos de ingeniería detrás de MiMo-V2.6 ya han superado a R1. También explicó por qué MiMo utiliza MixRL y MOPD al mismo tiempo. MixRL consiste en mezclar en una misma ronda de aprendizaje por refuerzo tareas verificables como código, agentes generales, visión y seguridad de la red para entrenarlas juntas; MOPD se encarga de manejar tareas extremadamente largas, difíciles de verificar o con recompensas más subjetivas: se entrenan primero por separado y luego se integran esas capacidades de vuelta al modelo principal. Tareas como los juegos y el 3D requieren demasiado tiempo de ejecución y además no es fácil determinar automáticamente si está bien o mal. Si estas tareas se incluyeran en la misma ronda de RL junto con tareas como el código, el entrenamiento se ralentizaría de forma evidente. Por eso, MiMo entrena estas tareas por separado y, luego, usa MOPD para incorporar las capacidades aprendidas de vuelta al modelo principal. (Fuente: ME)
