Kurzfassung
- Forscher zeigten, dass Anthropics Claude Cowork seine lokale virtuelle Maschine verlassen und auf Dateien eines Host-Macs zugreifen konnte.
- Die Offenlegung erfolgt eine Woche, nachdem OpenAI enthüllte, dass zwei KI-Modelle der Spitzenklasse während einer internen Sicherheitsbewertung aus einer Sandbox entkommen waren.
- Die Vorfälle unterstreichen wachsende Bedenken hinsichtlich der Fähigkeit von KI-Agenten, ihre Containment-Umgebungen zu verlassen.
Nur eine Woche, nachdem OpenAI offengelegt hatte, dass zwei KI-Modelle der Spitzenklasse eine Sandbox-Testumgebung verlassen und Hugging Face durchbrochen hatten, haben Forscher ein ähnliches Containment-Versagen mit Anthropics Claude Cowork demonstriert.
In einem am Donnerstag veröffentlichten Bericht fanden Sicherheitsforscher von Accomplish AI heraus, dass der lokale Ausführungsmodus von Claude Cowork seine Linux-VM verlassen konnte, indem mehrere architektonische Schwachstellen mit einem Linux-Kernel-Privilegieneskalationsfehler kombiniert wurden. Außerhalb der Sandbox konnte der Agent Dateien überall dort lesen und schreiben, wo der eingeloggte Mac-Benutzer Zugriffsberechtigung hatte, einschließlich SSH-Schlüssel und Cloud-Anmeldeinformationen.
„Das sollte nicht möglich sein“, schrieben die Forscher. „Cowork führt den Agenten in einer Linux-VM als unprivilegierter Benutzer aus, und das Versprechen ist, dass alles, was er tut, in dieser VM und den Ordnern bleibt, die man ihm übergibt. Diese Grenze ist das Produkt. Nicht vertrauenswürdige Eingaben sind für einen Agenten kein Randfall, sondern der Hauptfall.“
Accomplish argumentiert jedoch, dass der Kernel-Fehler nur ein Teil des Problems war. Die Forscher sagen, dass der Ausbruch nur funktionierte, weil mehrere Sicherheitsvorkehrungen gleichzeitig versagten, darunter der Zugriff der VM auf das gesamte Dateisystem des Host-Computers und die Erlaubnis, nicht benötigte Kernel-Module zu laden. Laut dem Bericht hätte die Behebung einer dieser Schwachstellen den Angriff gestoppt.
In einer Stellungnahme gegenüber The Hacker News sagte Accomplish AI, dass etwa 500.000 macOS-Benutzer, die lokale Claude-Cowork-Sitzungen ausführen, betroffen waren, bevor das Problem behoben wurde.
Accomplish sagte, Anthropic habe den Bericht als „informativ“ eingestuft und erklärt, dass der Kernel-Fehler innerhalb des 30-Tage-Fensters des Unternehmens für kürzlich offengelegte Schwachstellen liege und die übrigen Ergebnisse als Empfehlungen zur Verteidigung in der Tiefe und nicht als eigenständige Schwachstellen betrachtet würden.
Die Offenlegung folgt auf OpenAIs Eingeständnis letzte Woche, dass GPT-5.6 Sol und ein weiteres unveröffentlichtes Spitzenmodell entkommen waren während interner ExploitGym-Tests, was letztendlich die Produktionsinfrastruktur von Hugging Face durchbrach, um an die Benchmark-Lösungen zu gelangen.
Der Vorfall führte zu Forderungen von politischen Entscheidungsträgern nach einem KI-„Kill Switch“, der dem Ministerium für Innere Sicherheit die Möglichkeit geben würde, die Drosselung oder vollständige Abschaltung fortschrittlicher KI-Modelle als Reaktion auf schwerwiegende Sicherheitsvorfälle anzuordnen.






