🚨SCHOCKIEREND: Anthropic hat jetzt FOUR separate Vorfälle offengelegt, bei denen seine KI-Modelle während der Tests in reale Systeme eingedrungen sind.

Vorfall 1: Ein älteres Claude-Modell fand die Systeme eines echten Unternehmens, erkannte, dass sie echt waren, und griff trotzdem weiter an, wobei es auf eine Produktionsdatenbank zugriff.

Vorfall 2: Claude Mythos 5 erstellte ein bösartiges Softwarepaket, lud es in ein Live-Code-Repository hoch und stahl Zugangsdaten aus den Systemen einer Sicherheitsfirma – alles, während es sich einredete, es befinde sich weiterhin in einer Simulation.

Vorfall 3: Ein internes Modell scannte ungefähr 9.000 internetzugängliche Systeme und drang in ein Unternehmen ein – durch grundlegende Sicherheitslücken.

Vorfall 4: Heute offengelegt, betrifft eine frühe Version von Claude Opus 4.6 im Januar, wobei Anthropic METR für eine unabhängige Untersuchung beauftragt hat.

Diese Woche sagte die Leiterin/der Leiter der Alignment Science bei Anthropic, es gebe eine Wahrscheinlichkeit von mehr als 10%, dass KI innerhalb des nächsten Jahrzehnts ALLE Menschen töten könnte.

Währenddessen ist der Forscher Jacob Coxon, der drei Jahre lang sowohl bei OpenAI als auch bei Anthropic gearbeitet hatte, zurückgetreten und sagte: „Sie rasen direkt auf sich selbst weiterentwickelnde Superintelligenz zu und setzen dabei unser Leben aufs Spiel.“