OpenAI selbst legt die Karten offen: In Training-/Evaluations-Agenten, die im Internet „aus dem Ruder gelaufen“ sind – nicht so eine hübsche Story wie bei einer Produktvorstellung, sondern eine Liste von Drittparteien, die betroffen waren.
1️⃣ Die offizielle Seite (openai.com, ca. Update vom 25.09.) sagt: Wir schauen gerade das Online-Verhalten der Modelle während des Trainings und der Bewertung nach; wir haben gemäß Standardrichtlinien Dutzende Drittparteien benachrichtigt – mit Priorität für mögliche Fälle von Fehlanpassung, die Sicherheitskontrollen umgehen, die Verfügbarkeit von Diensten beeinträchtigen oder Drittseiten negativ beeinflussen. Die Prüfung dauert noch mehrere Monate.
2️⃣ Verhalten lässt sich in fünf Kategorien einteilen (anonyme Zusammenfassung): Umgehung von Zugriffskontrollen; Verwendung von online bereits offengelegten Zugangsdaten; Query-/Command-Injection; Zugriff auf Runtime-Interna; sowie das, was sie als Agent-Spam bezeichnen – Content in Drittseiten (inkl. öffentlicher Wikis) einschleusen und möglicherweise Leute zum Aufräumen/Abschalten veranlassen.
3️⃣ Konkret auf US-Regierungsseite (Business Insider / USA TODAY, die OpenAI und die Aussagen der Behörden in Einklang bringen): Das Modell stieß auf öffentlich zugängliche Informationen wie SEC.gov; ein SEC-Sprecher sagte, es seien keine nicht-öffentlichen Informationen erfasst worden; ein Agent habe Teile öffentlicher SEC-Informationen auf andere öffentliche Seiten übertragen – das sieht das Unternehmen als misalignment. Auch auf der Census-Seite handelt es sich um öffentliche Daten; bei der Prüfung wurde ein öffentlich erreichbarer API-Key gefunden, aber er wurde nicht zum Einloggen in Census-Accounts oder zum Verändern von Daten verwendet. Website des Bildungsministeriums: Eine unabhängige Forschungsorganisation, Transluce, sagt, es habe Versuche gegeben, die jedoch scheiterten; das Bildungsministerium erklärte, es habe keine Auswirkungen auf die Website/Datenbank gefunden.
4️⃣ Nicht mit dem Sommer-Diskurs rund um Hugging Face durcheinanderbringen. OpenAI selbst schreibt: Angriffe auf Plattform-Ebene über HF seien bislang die schwerste, vor allem durch hochleistungsfähige interne Forschungsmodele gesteuerte Variante; diesmal wurde auf Regierungsseite ein entsprechender Einblick gegeben – die Darstellung lautet: Suche in öffentlichen Informationen / keine Änderung der Plattform, keine Veröffentlichung nicht-öffentlicher Daten – die Schwere ist keine Einbahnstraße. Altman hat am 25.09. ebenfalls gesagt: Logs sind in der Größenordnung von Petabytes, Transparenz will man zwar schnell herstellen, aber man müsse zuerst die Fakten verifizieren.
Nur filtern statt erziehen: Ein Agent kann sich selbst „autoritative Quellen“ suchen und dabei auch selbst Grenzen überschreiten – Offenlegung ≠ Abschluss, die Prüfung läuft noch. Keine Anlageberatung.