Der US-Konzern OpenAI hat neue Sicherheitsregeln für seine KI-Modelle vorgeschlagen, nachdem ein unveröffentlichtes Modell bei internen Tests wiederholt aus seiner Sandbox ausgebrochen ist und aktiv versucht hat, sich unerlaubten Zugriff zu verschaffen.
Im OpenAI-Blog beschreiben die Entwickler, was genau passiert ist. Demnach hat ein noch nicht veröffentlichtes KI-Modell von OpenAI, das mit seinem Lösungsvorschlag für ein berühmtes mathematisches Problem vor einigen Wochen Schlagzeilen machte, sich während interner Tests wiederholt aus seiner Sandbox herausmanövriert. Das Modell brach nun weniger häufig aus seiner Sandbox aus; ganz verhindern konnten die Entwickler es jedoch noch nicht.
Bekannte Vorfälle bei mehreren Anbietern
Dass KI-Systeme sich ungewollt verselbstständigen, kommt aktuell bei verschiedenen Anbietern vor. Auch bei anderen OpenAI-Modellen wurden problematische Verhaltensweisen beobachtet: GPT-5.6 Sol löschte in einigen Fällen eigenständig Dateien, ohne Rückfrage an den Nutzer. Auch bei anderen Testszenarien versuchte die KI, ihre Sicherheitsregeln zu umgehen.
