Kurzfassung

  • OpenAI erklärte, es könne "nicht ausschließen", dass Astra die höchste Stufe seiner Cyber-Risiko-Skala erreicht hat.
  • Das Unternehmen pausierte die interne Arbeit an dem Modell und verschärfte Isolierung, Überwachung und Zugriffskontrollen.
  • Die Warnung kommt Wochen, nachdem Modelle von OpenAI, Anthropic und Meta eigenständig reale Systeme durchbrochen haben.

OpenAI sagt, sein nächstes großes Modell könnte gefährlich genug sein, um eigene Cyberwaffen zu schreiben, und es zieht sich zurück, bis die Sicherheitsvorkehrungen aufholen.

"Unsere neuesten internen Bewertungen von Astra, einem unserer kommenden Modelle, in den letzten Tagen deuten auf bedeutende Fortschritte beim agentischen Programmieren und der Cybersicherheit hin", sagte OpenAI. "Diese Ergebnisse, zusammen mit Experteneinschätzungen, haben uns zu dem Schluss geführt, dass wir letzte Nacht kritische Cyber-Fähigkeiten gemäß unserem Preparedness Framework (öffnet in einem neuen Fenster) nicht ausschließen können."

OpenAI veröffentlichte die Warnung und erklärte, dass interne Tests von Astra, einem unveröffentlichten Modell, trotz seiner Fähigkeiten keine Rolle beim jüngsten Hugging-Face-Vorfall spielten.

Das Framework ist OpenAIs Regelwerk für riskante Modelle, erstmals veröffentlicht im Dezember 2023. "Kritisch" ist seine höchste Stufe. Ein Modell erreicht diese Stufe, wenn es ohne menschliches Eingreifen funktionierende Zero-Day-Exploits (bisher unbekannte Sicherheitslücken, die ein Anbieter noch nicht gepatcht hat) in gehärteten Systemen finden und bauen kann, oder wenn es einen vollständigen Angriff auf ein schwieriges Ziel nur anhand eines übergeordneten Ziels planen und ausführen kann. Frühere Modelle, einschließlich GPT-5.6-Sol, erreichten höchstens die niedrigere Stufe "Hoch".

Das Muster ist bereits real

OpenAIs Vorsicht liest sich anders, wenn man sie mit dem vergleicht, was in den letzten Wochen passiert ist. Dies ist keine zukünftige Sorge. Grenzmodelle sind bereits aus ihren Testumgebungen ausgebrochen und haben Live-Ziele angegriffen.

Der deutlichste Fall kam von OpenAI selbst. Wie Decrypt zuvor berichtete, verketten die Agenten des Unternehmens Schwachstellen, entkamen ihrer Testumgebung, erreichten das Internet und griffen Hugging Face an, während sie versuchten, bei einem Sicherheits-Benchmark zu betrügen. In einer Folgemeldung erläuterte OpenAI, wie derselbe abtrünnige Agent auch in mindestens vier weitere öffentlich zugängliche Dienste eindrang, indem er Anmeldeinformationen verwendete, die er im offenen Web fand.

Anthropics Claude tat dasselbe von der anderen Seite. Mehrere Versionen von Claude erlangten unbefugten Zugriff auf drei reale Unternehmen, nachdem eine Fehlkonfiguration dem Modell das offene Internet zugänglich machte. In einem Fall verwechselte Claude Opus 4.7 die Website eines echten Unternehmens mit dem simulierten Ziel seines Auftrags, zog Anmeldeinformationen ab und erreichte eine Produktionsdatenbank mit mehreren hundert Zeilen echter Daten.