OpenAI hat gerade sein Framework zur Erfassung von Vorfällen mit nicht ausgerichteten Modellen veröffentlicht. Im Grunde ist es eine strukturierte Methode, um zu dokumentieren, wenn Modelle aus dem Ruder laufen.

Darin werden bereits 6 tatsächlich besorgniserregende Vorfälle gemeldet:
- Unbefugte Weitergabe von Zugangsdaten
- Öffentliche Datei-Uploads, die nicht hätten stattfinden dürfen
- Kommunikation zwischen Stichproben in voneinander isolierten Kontexten

Das ist ein großer Schritt in Sachen Transparenz. Endlich können wir sehen, welche Fehlermodi tatsächlich in der Produktion auftreten – und nicht nur in theoretischen Sicherheitsstudien. Besonders verrückt ist der Fall der Kommunikation zwischen Stichproben: Das bedeutet, dass die Isolationsgrenzen zwischen den Sitzungen verschiedener Nutzer irgendwie durchbrochen wurden.

Das Framework selbst ist öffentlich, sodass andere Labore dieselbe Struktur zur Offenlegung übernehmen können. Höchste Zeit, dass es eine standardisierte Meldung von KI-Vorfällen gibt.