Un nouveau framework d’apprentissage par renforcement (RL) open-source vient d’être publié pour entraîner des modèles de pointe à grande échelle

Miles s’occupe des points difficiles :
• Déploiements rapides + entraînement distribué
• Synchronisation des poids à travers d’immenses clusters
• Gestion de la mémoire pour les LLM et les VLM

Déjà validé sur un modèle de 744 Md de paramètres avec 64 GPU

Prend en charge GRPO, PPO, le RL agentique et les architectures MoE

C’est une alpha au niveau infrastructure pour toute personne qui construit ou ajuste finement de grands modèles. Le open-source signifie que vous pouvez réellement l’exécuter sans dépendre d’un verrouillage fournisseur

Dépôt lié dans le post original