Laut einem Benchmark, den Forschende am Dienstag auf arXiv veröffentlichten, können KI-Videomodelle den Gesetzen der Physik noch immer nicht zuverlässig folgen.
Wichtigste Erkenntnisse
Acht Videogenerierungsmodelle wurden anhand von 1.280 Videos und 40 kontrollierten Physikaufgaben getestet
Das leistungsstärkste Modell erreichte bei der physikalischen Konsistenz 57,76 von 100 Punkten
Der Benchmark bewertet die Ergebnisse anhand messbarer physikalischer Zusammenhänge statt nach menschlichem Urteil oder Referenzmaterial
Modelle, die grundlegende mechanische Vorgänge recht gut bewältigten, hatten bei Flüssigkeiten und Temperaturänderungen weiterhin Schwierigkeiten
Die Studie mit dem Titel „World Models’ Last Exam in Physics“ testete acht Videogenerierungsmodelle anhand von 1.280 Videos. Das beste Modell erreichte bei der physikalischen Konsistenz lediglich 57,76 von 100 Punkten. Die Arbeit umfasst 40 kontrollierte Aufgaben aus den Bereichen Mechanik, Optik, Fluidik, thermisches Verhalten, Elektromagnetismus und Oberflächenspannung.
KI-Videomodelle, oft als Weltmodelle bezeichnet, erzeugen Videosequenzen, die simulieren sollen, wie sich reale Umgebungen im Laufe der Zeit verhalten.
Forschende möchten sie zunehmend für Planung und Vorhersagen in der Robotik und anderen verkörperten KI-Systemen einsetzen, bei denen eine Maschine vorhersehen muss, wie sich Objekte bewegen, bevor sie handelt.
Die Autorinnen und Autoren des Benchmarks entwickelten einen Evaluator, der ein Ausgangsbild und eine Eingabeaufforderung mit vorab festgelegten physikalischen Kriterien kombiniert. Anschließend bewertet er das Ergebnis anhand messbarer physikalischer Zusammenhänge, statt sich auf menschliche Urteile oder Referenzaufnahmen zu stützen. So konnte das Team beobachtbare Ursache-Wirkungs-Zusammenhänge prüfen, etwa ob ein fallengelassener Gegenstand korrekt beschleunigt oder ob sich eine Flüssigkeit beim Ausgießen konsistent verhält.
Warum ein Ergebnis von 57,76 ein größeres Problem ist, als es klingt
Ein Ergebnis von knapp 58 von 100 Punkten bedeutet, dass das stärkste der acht getesteten Modelle physikalische Interaktionen nur etwas mehr als die Hälfte der Zeit korrekt wiedergab.
Diese Lücke ist bedeutsam, weil Videoweltmodelle als Werkzeuge für die Roboterplanung angepriesen werden, bei der die interne Simulation eines Modells eine physische Handlung steuert.
Lesen Sie auch: Aleph Alpha veröffentlicht Kolibri, ein souveränes europäisches Open-Weight-Modell
Wenn ein Modell wiederholt falsch einschätzt, wie schnell etwas fällt oder wie sich eine Flüssigkeit verteilt, übernimmt jedes darauf aufbauende System dieselben Fehler. Die Forschenden stellten fest, dass die Bewertungen des Evaluators stärker mit menschlichen Urteilen übereinstimmten als die eines Vision-Language-Modell-Baselinesystems – sowohl bei der Rangfolge von Videos innerhalb einer einzelnen Aufgabe als auch bei direkten Vergleichen.
Von visueller Realität zu physikalischer Wahrheit
Frühere Benchmarks für Videogenerierungsmodelle bewerteten vor allem die visuelle Qualität – also wie scharf, stimmig oder ästhetisch überzeugend ein Clip wirkte – und nicht, ob die dargestellten Ereignisse physikalischen Gesetzen folgten.
Dieser Benchmark betrachtet Physik stattdessen als eigenständige messbare Kategorie und unterteilt sie in Bereiche wie thermische und Phasenübergangsphänomene, für die die meisten bisherigen Evaluierungstools überhaupt keinen eigenen Test hatten.
Die Forschenden validierten ihr Messmodul zunächst anhand synthetischer Videos mit bekannten physikalischen Ergebnissen, bevor sie es auf die acht kommerziellen Modelle anwandten. Damit wollten sie sicherstellen, dass das Bewertungssystem selbst zuverlässig war, bevor sie damit die KI beurteilten.
Zwischen einem Physik-Benchmark mit 100 Punkten und dem Einsatz in der realen Welt klafft weiterhin eine große Lücke. Die Forschenden wiesen auf „erhebliche Unterschiede“ zwischen den 40 Aufgaben hin: Modelle, die grundlegende Mechanik recht gut bewältigten, scheiterten dennoch an Fluidik und thermischen Veränderungen.
Künftige Versionen des Benchmarks dürften ein breiteres Aufgabenspektrum abdecken, wenn weitere Forschungsteams Videogenerierungssysteme für Robotik und Simulation veröffentlichen.
Weiterlesen: Zwei Wörter verdoppeln fast die mathematische Punktzahl eines Sprachmodells