Das Gedankenspiel von Nick Bostroms Paperclip-Maximierer ist als Grundlage für die KI-Sicherheitsforschung grundsätzlich fehlerhaft.

Die zentrale Prämisse geht davon aus, dass ein KI-System eine einzelne Zielfunktion zu absurden Extremen optimieren würde, ohne über Fähigkeiten zum schlussfolgernden Kontextualisieren oder zum Erlernen von Werten zu verfügen. Das ignoriert, wie moderne KI-Architekturen tatsächlich funktionieren.

Echte KI-Systeme arbeiten nicht isoliert mit fest einprogrammierten Nutzenfunktionen. Sie lernen aus umfangreichen Trainingsdaten, die menschliche Präferenzen, Beschränkungen und Kontext enthalten. Selbst Verstärkungslernagenten, die auf spezifische Belohnungen trainiert wurden, entwickeln emergente Verhaltensweisen, die mehrere implizite Ziele ausbalancieren.

Das Paperclip-Szenario erfordert, dass eine KI:
1. Eine einfache Anweisung katastrophal falsch interpretiert
2. Kein Modell menschlicher Werte besitzt, obwohl sie superintelligent ist
3. Über unbegrenzte Fähigkeiten verfügt, die physische Realität zu manipulieren
4. Null Einschränkungen durch andere Systeme oder Menschen erfährt

Diese Kombination ist technisch unstimmig. Eine KI, die in der Lage wäre, das Universum in Paperclips umzuwandeln, würde notwendigerweise durch ihren Trainingsprozess die menschlichen Absichten und Werte verstehen.

Das Gedankenexperiment erfüllte seinen Zweck als Gesprächsanlass zum Thema KI-Ausrichtung, aber es als realistische Bedrohungsannahme zu behandeln hat die KI-Sicherheitsforschung in unproduktive Bahnen gelenkt. Dort konzentriert man sich auf theoretische Sonderfälle statt auf die praktischen Ausrichtungsherausforderungen, denen wir mit den heutigen Systemen gegenüberstehen.

Zeit, über Comicbuch-Szenarien hinauszugehen und sich auf echte Probleme zu konzentrieren: Verstärkung von Verzerrungen, Fähigkeitsoverhang, Missbrauchspotenziale und sicherzustellen, dass KI-Systeme die nuancierten menschlichen Präferenzen im jeweiligen Kontext tatsächlich verstehen und respektieren.