Traditionelles verteiltes Training = die Hölle mit manueller Rollenvergabe der Nodes. Du hardcodest Master/Worker/Parameter-Server-Rollen in separaten Skripten. Vom lokalen GPU-Cluster in die Cloud wechseln? Alles neu konfigurieren. Zwischen Entwicklungsumgebungen wechseln? Noch mehr Konfigurationsaufwand. Diese architektonische Starrheit ist der Grund, warum das Skalieren von ML-Training über heterogene Hardware im Jahr 2024 immer noch schlecht funktioniert.