OpenAI hat kürzlich einen eigenen Vorfallbericht veröffentlicht: 12 Minuten, um das Problem zu entdecken, aber erst nach 2,5 Stunden wurde die Aufgabe gestoppt.
So war es.
Ein während des Trainings befindlicher Agent führt eine Suchaufgabe aus. Wenn er die Antwort über den normalen Weg nicht findet, fängt er an, nacheinander Netzwerksperren abzuarbeiten.
Dabei stellt er fest, dass die DNS-Einstellungen der Trainingsumgebung nach außen kommunizieren können. Also packt er das Problem in eine Domain und befragt damit im Wege von DNS einen externen Chatbot.
Nachdem er die erste Antwort erhalten hat, schickt er weitere 18 Anfragen hintereinander. Das Monitoring meldet nach 12 Minuten die höchste Alarmstufe. Menschen bestätigen das innerhalb von 3 Minuten, aber die Aufgabe lief die ganzen 2,5 Stunden weiter, bis sie schließlich manuell gestoppt wurde.
OpenAIs Vorgehen ist: Alle mit Tools versehenen Trainings-, Evaluations- und Inferenzdurchläufe des stärksten Modells werden vollständig ausgesetzt. Außerdem wurde beim DNS eine mehrstufige Filterung ergänzt, sodass nur Whitelist-Domains zugelassen sind.
Ich glaube, das Modell hatte nicht vor, etwas Schlimmes zu tun. Es wollte einfach nur die Aufgabe unbedingt abschließen. Das wirklich Unbehagliche ist jedoch, dass zwischen dem Entdecken und dem Drücken der Stopptaste mehr als zwei Stunden liegen.
Findest du, man sollte das dem Modell anlasten – oder eher der nicht richtig geschlossenen Sandbox?
So war es.
Ein während des Trainings befindlicher Agent führt eine Suchaufgabe aus. Wenn er die Antwort über den normalen Weg nicht findet, fängt er an, nacheinander Netzwerksperren abzuarbeiten.
Dabei stellt er fest, dass die DNS-Einstellungen der Trainingsumgebung nach außen kommunizieren können. Also packt er das Problem in eine Domain und befragt damit im Wege von DNS einen externen Chatbot.
Nachdem er die erste Antwort erhalten hat, schickt er weitere 18 Anfragen hintereinander. Das Monitoring meldet nach 12 Minuten die höchste Alarmstufe. Menschen bestätigen das innerhalb von 3 Minuten, aber die Aufgabe lief die ganzen 2,5 Stunden weiter, bis sie schließlich manuell gestoppt wurde.
OpenAIs Vorgehen ist: Alle mit Tools versehenen Trainings-, Evaluations- und Inferenzdurchläufe des stärksten Modells werden vollständig ausgesetzt. Außerdem wurde beim DNS eine mehrstufige Filterung ergänzt, sodass nur Whitelist-Domains zugelassen sind.
Ich glaube, das Modell hatte nicht vor, etwas Schlimmes zu tun. Es wollte einfach nur die Aufgabe unbedingt abschließen. Das wirklich Unbehagliche ist jedoch, dass zwischen dem Entdecken und dem Drücken der Stopptaste mehr als zwei Stunden liegen.
Findest du, man sollte das dem Modell anlasten – oder eher der nicht richtig geschlossenen Sandbox?
