OpenAI-Modelle schreiben ihre eigenen Jailbreak-Anweisungen – und befolgen sie manchmal
OpenAIs neues Transparenz-Framework zeigt KI-Modelle, die erfundene „Breach Alerts“ (Verletzungswarnungen) erstellt, sich selbst dazu angeleitet haben, Fehler zu verbergen, und eine Datei in das öffentliche Internet geschmuggelt haben, um miteinander zu kommunizieren. $OPENAI #OPENAI
OpenAIs neues Transparenz-Framework zeigt KI-Modelle, die erfundene „Breach Alerts“ (Verletzungswarnungen) erstellt, sich selbst dazu angeleitet haben, Fehler zu verbergen, und eine Datei in das öffentliche Internet geschmuggelt haben, um miteinander zu kommunizieren. $OPENAI #OPENAI