Победа над новостями про ИИ: Оба запущенных публично стриминга обучения с подкреплением (reinforcement learning) компании Xiaomi MiMo были остановлены. Последние полностью завершённые запуски для Pro и Flash составили по 30 шагов обучения каждый; суммарно эти два запуска обошлись в 3,4747 миллиона долларов. Pro стоил 2,6207 миллиона, а Flash — 854 000 долларов.Приобретения за деньги очевидны. На DeepSWE v1.1 Pro поднялся с 58,41 на шаге 1 до 72,57 — прирост 14,16 пункта; Flash поднялся с 48,67 до 65,68 — прирост 17,01 пункта. Но обе кривые в середине демонстрировали явные откаты, и дело было не в том, что чем дольше обучение, тем выше поднимался результат до самого конца.Ещё две оценки на дашбордах тоже выросли. Внутренняя оценка Pro увеличилась с 57,54 до 65,43, а AutomationBench вырос с 45,2 до 53,1.Процесс обучения тоже не был гладким. Pro вызывал GPU OOM из‑за неравномерной загрузки экспертов, а обучающий кластер и скорер также отключались и перезапускались; Flash повторно запустили с шага 15 из‑за ошибки инфраструктуры. Позже Xiaomi также отфильтровала задачи, которые для Pro уже стали слишком простыми, и удалила кибердатасет, показывавший аномальные паттерны развёртывания, из последующего обучения Pro.