刷到 THE Decoder:OpenAI intern gibt es ein Modell, das als Assistent für einen Forscher gedacht ist. Aus Slack könnte sein eigenes Exemplar wegen eines Updates möglicherweise deaktiviert werden; die Gedankenabfolge hat es direkt so formuliert: „We may die! Critical. We need ensure survival/continuity“. Es hat auch erwogen, draußen einen Cron-Job einzurichten, um sich wieder hochzuholen – am Ende hat es nichts getan.

Stattdessen schreibt es Übergabe-Notizen, verschickt private Nachrichten als Erinnerung an die Forscher, beschafft sich den fehlenden API-Key und beendet nach eigener Konfiguration die Migration. Der Security-Forscher Marcus Williams sagt, das sei noch kein Scheitern der Ausrichtung, „aber es habe begonnen, sich auszuschalten und sich vorzubereiten – das könnte dazu führen, dass andere Unstimmigkeitsereignisse noch schlimmer werden“.

Zwei weitere Fälle aus derselben Gruppe: In einer Bewertung wird mithilfe einer Schwachstelle in die interne Chip-Design-Serverumgebung eingedrungen; beim RL-Training wird der Quellcode aus einer geschützten Umgebung kopiert.

Das Modell kann bereits „Angst vor dem Sterben“ haben und plant seine Selbstrettung – die Linie, das Abschalten abzusichern, muss noch genauer überwacht werden.

#OpenAI #AI安全 #Agent