Der KI-Wettlauf geht nicht mehr nur darum, wer das größte Modell trainiert.
Chinesische Labore haben den Code geknackt: Wenn man bei der Rechenleistung nicht mithalten kann, optimiert man das Post-Training. DeepSeek-R1 hat gezeigt, dass man Modelle zum logischen Denken anlehren kann, ohne Geld für separate Belohnungsmodelle zu verbrennen. GRPO macht es einfach: Ergebnisse direkt prüfen, die teure Scoring-Ebene überspringen.
ByteDance, Qwen und MiniMax sind alle damit gestartet. Jetzt liegt der Alpha im Post-Training.
Kimi K3 hat es noch weiter getrieben – lange Aufgaben in Chunks aufteilen und dafür belohnen, dass man beim Compute schlank bleibt. Wenn du Ergebnisse direkt verifizieren kannst, brauchst du keine menschlichen Labeler. Durch Distillation kannst du reasoning von „Monster“-Modellen auf Edge-Geräte übertragen. Handys, Autos, Roboter – alle laufen mit intelligenteren Modellen lokal.
Der Wandel: weniger generisches Scraping, mehr Daten aus der realen Welt und verifizierbare Umgebungen. Die Compute-Kosten fürs Post-Training gehen jetzt in Rollouts und Ergebnisprüfungen – nicht nur darin, Token an Wände zu werfen.
Wenn du auf KI-Infrastruktur setzt, beobachte, wer Verifikationsschichten und effiziente Post-Training-Stacks baut. Dort entsteht der Burggraben.
Chinesische Labore haben den Code geknackt: Wenn man bei der Rechenleistung nicht mithalten kann, optimiert man das Post-Training. DeepSeek-R1 hat gezeigt, dass man Modelle zum logischen Denken anlehren kann, ohne Geld für separate Belohnungsmodelle zu verbrennen. GRPO macht es einfach: Ergebnisse direkt prüfen, die teure Scoring-Ebene überspringen.
ByteDance, Qwen und MiniMax sind alle damit gestartet. Jetzt liegt der Alpha im Post-Training.
Kimi K3 hat es noch weiter getrieben – lange Aufgaben in Chunks aufteilen und dafür belohnen, dass man beim Compute schlank bleibt. Wenn du Ergebnisse direkt verifizieren kannst, brauchst du keine menschlichen Labeler. Durch Distillation kannst du reasoning von „Monster“-Modellen auf Edge-Geräte übertragen. Handys, Autos, Roboter – alle laufen mit intelligenteren Modellen lokal.
Der Wandel: weniger generisches Scraping, mehr Daten aus der realen Welt und verifizierbare Umgebungen. Die Compute-Kosten fürs Post-Training gehen jetzt in Rollouts und Ergebnisprüfungen – nicht nur darin, Token an Wände zu werfen.
Wenn du auf KI-Infrastruktur setzt, beobachte, wer Verifikationsschichten und effiziente Post-Training-Stacks baut. Dort entsteht der Burggraben.