Mensagem da IA da ME: analise as notícias do Beating AI. Após o lançamento do MiMo-V2.6, a responsável da Xiaomi MiMo, Luo Fuli, explicou ainda mais esse ciclo de reforço por aprendizagem. Ela disse que participou do DeepSeek R1, e que, na sua visão, as inovações de pesquisa e os desafios de engenharia por trás do MiMo-V2.6 já superaram o R1. Ela também explicou por que o MiMo usa MixRL e MOPD ao mesmo tempo. O MixRL mistura, na mesma rodada de reforço por aprendizagem, códigos, agentes gerais, tarefas verificáveis como visão e segurança cibernética para treinamento conjunto; o MOPD, por sua vez, lida com tarefas muito longas, difíceis de verificar ou cujo incentivo/recompensa é mais subjetivo — treina essas capacidades separadamente e depois integra essas habilidades de volta ao modelo principal. Tarefas como jogos e 3D têm um tempo de execução muito longo e é difícil avaliar automaticamente o que está certo ou errado. Se essas tarefas forem colocadas na mesma rodada de RL que tarefas de código, o treinamento será claramente mais lento. Por isso, o MiMo treina esse tipo de tarefa separadamente e, depois, usa o MOPD para reunir as capacidades aprendidas de volta ao modelo principal. (Fonte: ME)