OpenAI ChatGPT 5- und DeepSeek V4 Flash-Modelle erreichten bei Cybersicherheitsaufgaben sehr hohe Erfolgsquoten.

Die Testergebnisse von CyberGym zeigen, dass sich die KI rasch von der bloßen Codeerstellung hin zur Erkennung echter Sicherheitslücken und deren unabhängiger Reproduktion entwickelt.

Der Benchmark umfasst:
- 1507 echte Sicherheitslücken
- 188 Softwareprojekte
- anspruchsvolle Aufgaben zum Ausnutzen von Sicherheitslücken und zum Beheben derselben.

Die bisher höchste Punktzahl lag bei etwa 20 %. Berichte deuten darauf hin, dass die neuesten spezialisierten Agenten unter aktualisierten Testbedingungen 90 % übertreffen.

Die KI kann nun:
- bekannte Sicherheitslücken reproduzieren.
- „Zero-Day“-Sicherheitslücken entdecken.
- unvollständige Patches identifizieren.

Interessanterweise kann dieselbe Technologie die Cybersicherheitsabwehr stärken oder die Angriffe verstärken.