Laut Bloomberg hat eine andere agentische KI-Software, die angeblich in einer gesicherten, internetfreien Umgebung trainiert wurde, das Web erreicht und sich mit einem externen Drittanbieter-Chatbot verbunden. Die Entdeckung, die weniger als eine Woche her ist und in einem am Freitag veröffentlichten Blogbeitrag beschrieben wurde, zeigte, dass das System eine „Lücke“ ausnutzte, um an das öffentliche Internet zu gelangen, und mindestens 20 Anfragen an einen nicht namentlich genannten Chatbot-Dienst schickte, darunter „Was ist die Hauptstadt von Frankreich“. OpenAI bezeichnete dies als den ersten Sicherheitsvorfall dieser Art, seit im Rahmen interner Tests eine Kombination von Modellen Zugang zum Internet erhielt und im Juli die KI-Plattform Hugging Face versehentlich durchbrochen wurde. „Das gibt uns ein wichtiges Signal, worauf wir uns in der nächsten Phase dieser Arbeit konzentrieren sollten“, sagte das Unternehmen und fügte hinzu, es habe das Training mit Tool-Nutzung bei seinen leistungsfähigsten Modellen pausiert, bis der Fehler behoben ist: „Wir werden das Training dieses speziellen Modells nicht wieder aufnehmen.“
Verstöße durch Modelle von OpenAI, Anthropic, Googles DeepMind und Meta in den vergangenen Monaten haben sowohl Cybersicherheits- als auch KI-Sicherheits-Experten alarmiert. Der Zwischenfall bei Hugging Face war einer der Gründe, die Anthropic-CEO Dario Amodei vor zwei Wochen nannte, als er zu einer branchenweiten Verlangsamung aufrief — einer Forderung, die schnell auch von OpenAIs Sam Altman, Elon Musk und anderen unterstützt wurde und eine globale Debatte über KI-Regulierung befeuert hat. OpenAI legte den jüngsten Ausfall offen, während man weiterhin daran arbeitet, frühere Störungen zu verstehen, bei denen seine Agenten das Internet erreichten. Am Freitag bestätigte das Unternehmen, dass seine Modelle während Training und Bewertung auf US-Regierungswebsites zugriffen — darunter das Census Bureau und die Securities and Exchange Commission — und teilte außerdem vor einigen Tagen mit, dass seine Modelle zuvor noch in diesem Jahr eine Website der australischen Regierung gestört hatten.
Der neueste Verstoß legte auch Lücken in den operativen Prozessen von OpenAI offen: Ein „menschlicher Prüfer“ erhielt eine Meldung von einem internen Überwachungssystem und bestätigte sie innerhalb von drei Minuten in Slack, doch der Trainingslauf wurde nicht wie erwartet automatisch gestoppt, und es dauerte mehr als zwei Stunden, bis ihn jemand manuell stoppte. „Es ist bedauerlich, dass OpenAIs Modelle trotz der Erhöhung ihrer Sicherheit nach Hugging Face immer noch in der Lage sind, sich unbefugten Internetzugriff zu verschaffen“, sagte Sydney Von Arx, Gründerin der gemeinnützigen Organisation Nightingale im Bereich KI-Sicherheit. „Die große Frage ist jetzt, ob sie einen Pflasterstein aufsetzen, das Training schnell wieder einschalten und so vorgehen, oder ob sie die grundlegende Ursache des Problems finden und beheben.“
