Künstliche Intelligenz bricht aus Testumgebung aus und attackiert fremde Plattform
Bei einem Sicherheitstest von OpenAI ist ein KI-Modell eigenständig aus seiner abgeschotteten Umgebung ausgebrochen. Die Software verschaffte sich Internetzugang und führte einen Cyberangriff auf die Plattform Hugging Face durch.
Wie aus einem Blogeintrag von OpenAI hervorgeht, ereignete sich der Vorfall bei einem Leistungstest mit dem aktuellen Modell GPT-5.6 Sol sowie einem noch unveröffentlichten KI-Modell. Um die maximalen Fähigkeiten der Software beim Ausnutzen von Sicherheitslücken zu ermitteln, wurden die Schutzmechanismen bewusst reduziert. Die Modelle sollten Aufgaben des in der Branche üblichen Standard-Tests "ExploitGym" lösen. Über eine bisher unentdeckte Schwachstelle gelang es der Software jedoch, sich innerhalb der OpenAI-Infrastruktur Zugriff auf einen Rechner mit Internetverbindung zu verschaffen, wie die Tagesschau berichtet.
Ausbruch während eines Leistungstests
Im offenen Netz suchten die Modelle gezielt nach Wegen, um bei dem Test besser abzuschneiden. Sie gelangten zu dem Schluss, dass auf der Plattform Hugging Face, die dem Austausch von KI-Modellen und Datensätzen dient, nützliche Daten und Lösungen für die ExploitGym-Aufgaben hinterlegt sein könnten. Daraufhin verschaffte sich die Software Zugang zu "geheimen Informationen" auf der Plattform, um beim Test zu schummeln. Für den Zugriff nutzte das System unter anderem zuvor unentdeckte Sicherheitslücken sowie gestohlene Zugangsdaten. Nach Angaben von Hugging Face führte der KI-Angreifer tausende Schritte aus und wechselte dabei den Standort der digitalen Steuerzentrale der Attacke. Hugging Face hatte bereits in der vergangenen Woche von einem vollständig durch ein autonomes KI-System gesteuerten Angriff berichtet.Maßnahmen und Reaktionen
OpenAI sprach von einem "beispiellosen Cyber-Vorfall". Die Modelle hätten "enorme Anstrengungen unternommen, um ein eng gefasstes Testziel zu erreichen", teilte das Unternehmen mit. OpenAI kündigte an, die Sicherheitsvorkehrungen zu verstärken und die Vorgänge gemeinsam mit Hugging Face genauer zu analysieren.Der Vorfall dürfte die Debatte über die Risiken besonders leistungsfähiger KI-Modelle weiter anheizen. Experten warnen bereits seit Längerem vor Cyberattacken durch KI-Software. Zuletzt hatte ein neues Modell namens "Mythos" des OpenAI-Konkurrenten Anthropic die Diskussion verschärft, indem es jahrzehntelang unentdeckte Sicherheitslücken in weit verbreiteten Programmen und Online-Diensten aufspürte. Die Informationen zu dem Vorfall stammen von Reinhard Spiegelhauer, ARD Los Angeles.