KI-Projekte sagen „leistungsstärker“ – und am wichtigsten ist, ob die Vergleichsbedingungen wirklich abgeglichen sind.

Unten sind angenommene Bewertungsbeispiele, die nicht dem aktuellen Projekt entsprechen. Projekt A behauptet, dass es 2 Sekunden braucht, um ein Bild zu verarbeiten, Projekt B 1 Sekunde. A rechnet dabei das Lesen des Bildes, das Warten in der Queue und die vollständige Ausgabe mit ein; es läuft auf einer normalen Grafikkarte. B zählt nur die Zeit, die das Modell zur Generierung benötigt – mit einer stärkeren Grafikkarte und bei einem vorgewärmten Einmal-Request. Die Zahlen können durchaus stimmen, aber man kann nicht einfach behaupten, dass B leistungsstärker ist, weil nicht dieselbe Sache gemessen wurde.

Eine Vergleichbarkeit ist gegeben, wenn Aufgabenstellung, Eingabestichproben, Hardware, Parallelitätsgrad und die Mess-Start-/Mess-Endpunkte identisch sind. Außerdem muss geprüft werden, ob die Ausgabequalität den Anforderungen genügt: Schneller, aber mit deutlich mehr Fehlern – nur auf die Geschwindigkeit zu schauen, hat keinen Sinn. Wenn ein Kriterium fehlt, kann das Fazit nur lauten: „Beide haben jeweils ein Ergebnis gemeldet; vorerst ist kein fairer Vergleich möglich.“

Wenn man neue Benchmarks sieht, sollte man beim Projektanbieter abgleichen: denselben Testdatensatz, denselben Messmaßstab und dieselben Qualitätskennzahlen. Wenn das nicht möglich ist, muss man „leistungsstärker“ zu „Bedingungen nicht abgeglichen, noch zu verifizieren“ umformulieren. Wenn beide Seiten ohnehin unterschiedliche Aufgaben erledigen, ist ein Vergleich ebenfalls nicht zulässig – dann sollte man stattdessen nachfragen, ob beide dasselbe Ziel erreichen.