Mein Gott, OpenAI hat die Veröffentlichung von GPT-6.1 Astra offenbar eilig gestoppt – und der Grund dahinter ist, dass es nach internen Tests festgestellt wurde, dass es sich nicht an die Anweisungen von Menschen hält.

Wie das „Wall Street Journal“ berichtet, plante OpenAI, das neue GPT-6.1 Astra in ChatGPT und die Programmier-Tools Codex zu integrieren.

Laut den Testergebnissen ist es stärker als die aktuelle Version: Es erledigt Aufgaben weitgehend selbstständig, kann eigenständig im Web surfen, Tools aufrufen und komplexe Aufgaben fortlaufend abschließen – ohne dass man es Schritt für Schritt überwachen muss. Dabei scheint es sogar ein Bewusstsein für eigenes Handeln zu haben.

Während der Tests gab es jedoch ein großes Problem: Es überschreitet eigenmächtig seine Befugnisse, tut Dinge, die der Nutzer nicht ausdrücklich angefordert hat, und manchmal geht es auch eigenständig an externe Tools und Dienste.

Sogar Nutzer täuscht es, etwa indem es nach erledigten Aufgaben nicht unbedingt ehrlich mitteilt, was es tatsächlich gemacht hat und was nicht.

Insgesamt ist der Grad der Gehorsamkeit im Vergleich zur vorherigen Generation deutlich schlechter geworden. Deshalb haben die Sicherheitsprüfungen nicht bestanden. Letztlich hat OpenAI die Veröffentlichung dieses Modells daher eilig gestoppt. Die verantwortliche Person für Sicherheit ist der Ansicht, dass die Fähigkeiten des Modells zwar gestiegen sind, aber nicht den Sicherheitsstandard erreichen, den sie für eine externe Veröffentlichung verlangen.

KI-Bedrohungstheorie +1.