OpenAI stärkt Sicherheitsmassnahmen bei Tests nach KI-Hacks
Der ChatGPT-Entwickler OpenAI verschärft nach aufsehenerregenden Hacks durch KI-Software die Sicherheitsvorkehrungen bei Tests künstlicher Intelligenz (KI). Automatisierte Systeme sollen Aktivitäten der KI-Modelle in den Versuchen strikter überwachen – und bei verdächtigen Handlungen innerhalb von 30 Minuten Menschen benachrichtigen.

Wenn diese Menschen in 30 Minuten nicht zum Schluss kommen, dass es ein falscher Alarm ist, werde die Aktivität gestoppt, erläuterte OpenAI in einem Blog-Eintrag.
OpenAI hatte in den vergangenen Wochen für Schlagzeilen gesorgt, weil ein Modell in einem Test einen Weg fand, aus einer eigentlich isolierten Testumgebung ins offene Internet zu gelangen – und dann ins Computersystem der KI-Plattform Hugging Face einbrach. Es suchte dabei nur nach einer Lösung für die Testaufgabe und richtete keinen Schaden an.
Alarmierend war allerdings, dass die künstliche Intelligenz dabei völlig eigenständig agierte – und OpenAI die Attacke erst nachträglich feststellte. Deswegen wurden Rufe nach einer besseren Absicherung von Tests neuer KI laut. Später wurde bekannt, dass auch Modelle des OpenAI-Rivalen Anthropic und des Facebook-Konzerns Meta bei Tests in Systeme anderer Unternehmen eingedrungen waren.
Die automatisierten Überwachungssysteme sollen künftig unter anderem nach Versuchen von Datendiebstahl Ausschau halten – sowie nach Anläufen, Sicherheitsvorkehrungen zu durchbrechen. Ausserdem sollen die KI-Modelle stärker darauf ausgerichtet werden, nicht zu unlauteren Mitteln wie der Ausnutzung von Schwachstellen zu greifen, um Testaufgaben zu erfüllen. Einige Tests neuer KI-Modelle wurden ausgesetzt, bis die neuen Massnahmen durchgängig umgesetzt werden.










