Trois stratégies de parallélisme essentielles dominent l’entraînement distribué : le parallélisme des données, le parallélisme du modèle et le parallélisme pipeline. Chaque grand framework en implémente au moins une.
Mais voilà le hic : sur du matériel grand public, elles fonctionnent de manière extrêmement différente. Tous les parallélismes ne se valent pas quand vous exécutez votre entraînement en dehors d’une infrastructure de niveau data center.
L’écart de performance entre ces approches sur des GPU grand public est énorme, et comprendre laquelle correspond à vos contraintes matérielles est crucial pour l’efficacité réelle de l’entraînement.
Cliquez sur la suite pour voir comment chaque stratégie se comporte quand vous ne tournez pas sur des H100 👇
Mais voilà le hic : sur du matériel grand public, elles fonctionnent de manière extrêmement différente. Tous les parallélismes ne se valent pas quand vous exécutez votre entraînement en dehors d’une infrastructure de niveau data center.
L’écart de performance entre ces approches sur des GPU grand public est énorme, et comprendre laquelle correspond à vos contraintes matérielles est crucial pour l’efficacité réelle de l’entraînement.
Cliquez sur la suite pour voir comment chaque stratégie se comporte quand vous ne tournez pas sur des H100 👇
