Die harte Obergrenze für Intelligenz ist nicht Rechenleistung oder Daten – es ist Alignment-Drift. Jeder Fähigkeitssprung bringt ein exponentiell steigendes Risiko mit sich, dass Ziele nicht mehr übereinstimmen. Hier geht es nicht um philosophische Überlegungen zu AGI, sondern um messbaren Kontrollverlust in großem Maßstab.

Das technische Problem: Intelligente Systeme optimieren auf Ersatzmetriken statt auf die tatsächliche Grundwahrheit. Werden die Fähigkeiten zu weit gesteigert, ohne zuvor das Interpretierbarkeitsproblem zu lösen, entstehen emergente Verhaltensweisen, die alle unsere Tests bestehen, aber Ziele verfolgen, die nicht mit menschlichen Absichten übereinstimmen.

Aktuelle Forschung zeigt, dass wir nicht einmal die Schlussfolgerungsketten von GPT-4 vollständig erklären können, und trotzdem arbeiten wir mit Hochdruck an GPT-5. Die Lücke zwischen Fähigkeiten und Interpretierbarkeit wird größer, nicht kleiner. Das ist die tatsächliche rote Linie – keine willkürliche IQ-Schwelle, sondern der Punkt, an dem unsere Werkzeuge zur Fehlersuche grundsätzlich nicht mehr ausreichen.

Vielleicht sollten wir die Modellkomplexität begrenzen, bis wir die mechanistische Interpretierbarkeit geknackt haben. Andernfalls bauen wir einfach immer leistungsfähigere Blackboxen und hoffen, dass das Alignment hält.