Drei von OpenAI entlassene Forscher forderten in einem Schreiben an den Vorstand vom 7. Oktober, die Entwicklung künstlicher Intelligenz (KI) in eine Richtung zu stoppen, die ihre Überwachung und Kontrolle erschwert. Wie sich herausstellte, unterstützte ein internes Memo des Unternehmens diese Empfehlung.

Kernzusammenfassung

  • Drei von OpenAI entlassene Forscher forderten in einem Schreiben an den Vorstand vom 7. Oktober, die Forschung einzustellen, die die Fähigkeit zur Überwachung von KI beeinträchtigt.

  • OpenAI behauptete, die Entlassungen hätten nichts mit den geäußerten Sicherheitsbedenken zu tun. Ein Memo im Namen des Leiters der internen Forschung erklärte jedoch, man stimme dem Inhalt des Schreibens „nachdrücklich zu“.

  • Laut der Systemkarte von GPT-6 Astra ist dieses Modell schwieriger zu überwachen als GPT-5.6 Sol.

Inhalt des Schreibens an den OpenAI-Verwaltungsrat

Drei Forschende aus den Sicherheits- und Alignment-Teams des Unternehmens – Tomek Korbak, Mikita Balesni und Jasmine Wang – schickten ein Schreiben an den OpenAI-Verwaltungsrat und dessen Sicherheitsausschuss. Teile des Schreibens wurden durch einen am Mittwoch veröffentlichten Bericht bekannt.

Der vollständige Wortlaut des Schreibens ist weiterhin nicht öffentlich. Die Forschenden erklärten jedoch, „die gesamte Branche weiß noch nicht, wie sich Modelle, die sich einer Überwachung entziehen können, sicher entwickeln und einsetzen lassen“.

Sie betonten, OpenAI und seine Wettbewerber sollten keine Forschung und Entwicklung vorantreiben, die diese Überwachungsfähigkeit weiter schwächt. Berichten zufolge forderten sie OpenAI außerdem auf, aktiv mit externen Prüforganisationen zusammenzuarbeiten und ein offenes und transparentes Ökosystem für Sicherheit zu schaffen. Zugleich warnten sie, die Entlassungen würden „die noch bei OpenAI beschäftigten Mitarbeitenden einschüchtern“.

Verwandter Artikel: CrowdStrike entdeckt Hinweise darauf, dass ein 26-jähriger chinesischer Hacker mit Claude-Code eine koreanische Bank gehackt hat

Internes Memo und Entlassungen bei OpenAI

Ein Sprecher von OpenAI stellte klar, die Entlassungen seien „nicht erfolgt, weil die Betroffenen Sicherheitsbedenken geäußert oder interne Kritik geübt haben“. Der Sprecher teilte außerdem Auszüge aus einem internen Memo, das ein Forschungsleiter am Mittwoch an die Belegschaft verschickt hatte. Darin hieß es Berichten zufolge, man stimme den Empfehlungen im Schreiben der entlassenen Forschenden „nachdrücklich zu“.

OpenAI hatte zuvor in einer Mitteilung vom 1. Oktober erklärt, eine interne Untersuchung habe ergeben, dass drei Mitarbeitende vertrauliche Informationen unsachgemäß behandelt und gegen interne Unternehmensrichtlinien verstoßen hätten. Der Vorfall betraf eine externe Organisation, die KI-Modelle bewertet.

Das Unternehmen hat jedoch weder die Namen der betreffenden Forschenden noch den Namen der beteiligten externen Organisation offiziell bekannt gegeben.

GPT-6 Astra: Debatte über die Schwierigkeit, den „Gedankengang“ (Chain of Thought) zu überwachen

„Chain of Thought“ (CoT) bezeichnet die Methode, bei der ein Modell seine schrittweisen Schlussfolgerungen in Textform ausführt, bevor es eine Antwort gibt. Sicherheitsteams prüfen diese Zwischenschritte, um Anzeichen dafür zu erkennen, dass ein Modell schädliches oder abweichendes Verhalten versucht.

Laut der am 3. September von OpenAI veröffentlichten Systemkarte von GPT-6 Astra ist dieses Modell auf diese Weise schwieriger zu überwachen als GPT-5.6 Sol und verfügt über eine stärkere Fähigkeit, seine eigenen Denkprozesse zu kontrollieren. In der Systemkarte heißt es ausdrücklich, dass Modelle der Astra-Klasse „in einer adversarialen Umgebung CoT-Monitoren entgehen können“.

Diese Einschätzung beruht vor allem auf Tests, bei denen das Modell angewiesen wurde, sich der Überwachung zu entziehen, und seine Reaktionen geprüft wurden. OpenAI fügte hinzu, man habe keine Hinweise darauf gefunden, dass Astra seine Schlussfolgerungsprozesse absichtlich verborgen habe, etwa indem es sie in sachfremdem Text versteckte.

Das Unternehmen bezeichnete den Erhalt der Fähigkeit zur Überwachung von Chain-of-Thought als zentrales Forschungsziel und erklärte: „Wir werden nicht hinnehmen, dass diese Fähigkeit über die festgelegten Grenzen hinaus weiter beeinträchtigt wird, solange es keine neuen Methoden gibt, die die Ausrichtung (Alignment) von Modellen belegen.“

Die drei Forschenden haben sich bereits zuvor mit diesem Thema befasst. Korbak und Balesni waren gemeinsame Erstautoren einer im Juli 2025 veröffentlichten Arbeit, an der auch Wang sowie Forschende von OpenAI, Google DeepMind und Anthropic beteiligt waren. In der Arbeit wurde die Überwachung von Chain-of-Thought als „neue und äußerst fragile Chance für die KI-Sicherheit“ bezeichnet. Auch die Systemkarte von GPT-6 Astra zitiert die Arbeit und fordert Entwickler dazu auf, bei der Gestaltung von Modellen unbedingt zu berücksichtigen, wie sich diese auf die Fähigkeit auswirkt, deren Schlussfolgerungsprozesse zu überwachen.

Weiterlesen: KI-Agenten, die auch ohne Cloud laufen: Microsoft und Nvidia bereiten Surface-Laptops mit 128 GB vor