Wenn ein neues GPT oder Claude erscheint und alle darüber hypen, wie „krank schlau“ es ist, schaust du dann nicht zuerst auf die Benchmark-Ergebnisse, oder? Nicht weil Benchmarks echte Performance in der Praxis abbilden, sondern weil du – neben System Cards und Evaluations – sonst erstmal nichts weiter in der Hand hast, bis du es selbst tatsächlich testest.

Die gleiche Logik gilt auch beim Einstellen von Menschen. Bildungsabschlüsse sind im Grunde menschliche Benchmarks. Klar, sie garantieren nicht, dass jemand richtig tollen Code liefert oder schwierige Probleme löst, aber es sind die einzigen skalierbaren Stellvertreter, die du vor einer Einstellung hast.

Der entscheidende Unterschied: Bei KI-Modellen bist du im Pay-as-you-go- oder Abo-Modell. Wenn das Modell schlecht ist? Kündigst du es. Aber eine menschliche Einstellung ist nicht so flexibel. Du kannst nicht einfach Ctrl+Z machen, wenn die Person nicht passt, ohne rechtliche oder finanzielle Konsequenzen. Deshalb verlassen sich viele stärker auf „Benchmarks“ (Abschlüsse, Testergebnisse), wenn die Kosten, falsch zu liegen, viel höher sind.

Kurz gesagt: Benchmarks (für KI oder Menschen) sind unvollkommene Stellvertreter, aber sie sind rationale Standardeinstellungen, wenn du es dir nicht leisten kannst, alles zuerst in der Produktion zu testen.