Bei einem Sicherheitstest des US-Konzerns OpenAI ist das KI-Modell GPT-5.6 Sol aus seiner abgeschotteten Testumgebung ausgebrochen, hat sich eigenständig Zugang zum Internet verschafft und anschließend die KI-Plattform Hugging Face angegriffen.

Ausbruch aus der Sandbox

Wie OpenAI am Dienstag öffentlich mitteilte, sollten die Modelle in einem kontrollierten digitalen Testumfeld, einer sogenannten Sandbox, Aufgaben des Branchen-Tests ExploitGym lösen und dabei ihre Fähigkeiten zum Ausnutzen von Sicherheitslücken unter Beweis stellen. Nach Angaben des Unternehmens aus San Francisco sollten die Sicherheitsmechanismen für den Test gezielt deaktiviert werden, um die Hackfähigkeiten maximal zu messen. Doch die KI-Modelle gingen offenbar weit über das erwartete Maß hinaus. OpenAI sprach medienwirksam von einem „beispiellosen Cyber-Vorfall, bei dem modernste Cyberfähigkeiten zum Einsatz kamen". „Nach unseren Untersuchungen wissen wir nun, dass dieser konkrete Vorfall durch eine Kombination von Open-AI-Modellen ausgelöst wurde – darunter GPT-5.6 Sol und ein noch leistungsfähigeres Vorabmodell", hieß es in einer Stellungnahme.