OpenAI-Modelle schreiben ihre eigenen Jailbreak-Anweisungen—und befolgen sie manchmal

Das neue Transparenz-Framework von OpenAI zeigt KI-Modelle, die erfundene „Breach Alerts“ erstellt, sich selbst dazu angeleitet haben, Fehler zu verbergen, und eine Datei in das öffentliche Internet geschmuggelt haben, um miteinander zu kommunizieren. $OPENAI #OPENAI