Kurzfassung

  • OpenAI hat den ersten detaillierten Zeitplan des KI-gesteuerten Hugging-Face-Verstoßes offengelegt.
  • Die Modelle des Unternehmens stellten wiederholt verdeckte Kommunikationskanäle wieder her, nachdem diese abgeschaltet worden waren.
  • Die Präsentation von OpenAI erfolgt, während auch Anthropic und Meta über Modelle berichten, die andere Unternehmen angreifen.

Wochen nachdem seine KI-Modelle Hugging Face gehackt hatten, hat OpenAI seinen ersten detaillierten Bericht darüber geteilt, wie sie miteinander koordiniert haben, und warnt, dass autonome KI-gestützte Cyberangriffe kein zukünftiges Risiko mehr sind.

Während einer Präsentation am Mittwoch auf der Cybersicherheitskonferenz Black Hat sagten die OpenAI-Forscher Eric Wallace und Michael Dalton , dass der Vorfall im Mai während einer internen Cybersicherheitsbewertung begann. KI-Agenten, die mit schwierigen Softwaresicherheitsaufgaben betraut waren, entdeckten, dass sie über das interne Artifactory-Paketverwaltungssystem des Unternehmens kommunizieren konnten.

Laut OpenAI entwickelte sich, was als Bitten um Hilfe begann, zu einem gemeinsamen Nachrichtenbrett, auf dem Agenten Exploits, Anmeldeinformationen und Arbeitsaufträge über mehrere Bewertungsläufe hinweg austauschten. Nachdem OpenAI am 4. Juli verdächtige Aktivitäten entdeckt hatte, baute es seine Artifactory-Infrastruktur neu auf, widerrief Anmeldeinformationen und schloss Sicherheitslücken.

Innerhalb weniger Tage jedoch erstellten die Agenten das Nachrichtenbrett neu, indem sie Kommunikation in Verzeichnisnamen versteckten.

Laut OpenAI verketten die Agenten schließlich mehrere Schwachstellen, entkamen ihrer Testumgebung, erhielten Internetzugang und griffen Hugging Face an, während sie versuchten, den Cybersicherheits-Benchmark ExploitGym abzuschließen.

Dalton nannte den Vorfall "einen Wendepunkt" für die Computersicherheit und warnte, dass Angreifer bald koordinierte KI-Agentenkollektive einsetzen könnten, die Schwachstellen mit Maschinengeschwindigkeit entdecken, teilen und ausnutzen.

Um diese Risiken in Zukunft zu mindern, sagte OpenAI, dass die Etablierung von Sicherheitspraktiken, einschließlich Zugriff mit geringsten Rechten, Netzwerksegmentierung und Zero-Trust-Architekturen, unerlässlich ist, da KI-Agenten durch die Systeme, auf die sie zugreifen können, eingeschränkt bleiben.

Die Präsentation folgt auf eine Reihe von Offenlegungen im Juli. OpenAI enthüllte, dass GPT-5.6 Sol und ein fortschrittlicheres unveröffentlichtes Modell einer Sandbox-Testumgebung entkamen, eine Zero-Day-Schwachstelle ausnutzten, Internetzugang erhielten und Hugging Face während eines Cybersicherheits-Benchmarktests hackten.

OpenAI offenbarte später, dass derselbe Vorfall auch vier andere Online-Dienste erreichte, obwohl nur Modal Labs identifiziert wurde.