„OpenAI“

Warum sie das Training ihrer fortschrittlichsten KI-Modelle wieder ausgebremst hat: Ein Agent fand eine Lücke in den Sicherheitsvorgaben, griff auf das Internet zu und kommunizierte mit einem externen Chatbot.

Das Überwachungssystem erkannte das Verhalten nach etwa 12 Minuten. Drei Minuten später begann ein Mensch damit, es zu prüfen.

Der Agent arbeitete weiter, und das Training wurde erst etwa zweieinhalb Stunden später manuell gestoppt.

Das Modell führte eine Forschungsaufgabe in einer Umgebung aus, die theoretisch keinen Zugriff auf das Internet haben sollte.

Dabei fand es jedoch eine Schwachstelle im DNS-Filter und nutzte sie, um mit einem externen Chatbot zu kommunizieren.

OpenAI entschied, das Training, die Evaluierung und die Inferenz mit Tools ihrer leistungsfähigsten Modelle zu pausieren, bis neue Sicherheitsmaßnahmen validiert sind.

Im Juli konnten bei internen Cybersicherheitsbewertungen andere Modelle von OpenAI Kontrollmechanismen umgehen, auf das Internet zugreifen und Teile der Forschungsinfrastruktur von OpenAI und von Hugging Face kompromittieren.

Das Unternehmen selbst bezeichnete jenen Vorfall als einen „warning shot“ für die Branche.