W skrócie

  • Naukowcy wykazali, że Claude Cowork od Anthropic może opuścić swoją lokalną maszynę wirtualną i uzyskać dostęp do plików na hoście Mac.
  • Ujawnienie to następuje tydzień po tym, jak OpenAI poinformowało, że dwa zaawansowane modele AI uciekły z piaskownicy podczas wewnętrznej oceny bezpieczeństwa.
  • Incydenty te podkreślają rosnące obawy dotyczące zdolności agentów AI do opuszczania swoich środowisk izolacyjnych.

Zaledwie tydzień po tym, jak OpenAI ujawniło, że dwa zaawansowane modele AI uciekły z testowego środowiska piaskownicy i włamały się do Hugging Face, naukowcy wykazali podobną awarię izolacji dotyczącą Claude Cowork od Anthropic.

W raporcie opublikowanym w czwartek, naukowcy z Accomplish AI odkryli, że lokalny tryb wykonania Claude Cowork może opuścić swoją maszynę wirtualną Linux, łącząc kilka słabości architektonicznych z luką w podnoszeniu uprawnień jądra Linux. Po wydostaniu się z piaskownicy, agent mógł odczytywać i zapisywać pliki w dowolnym miejscu, do którego zalogowany użytkownik Mac miał uprawnienia dostępu, w tym klucze SSH i dane uwierzytelniające do chmury.

„To nie powinno być możliwe” – napisali naukowcy. „Cowork uruchamia agenta wewnątrz maszyny wirtualnej Linux jako nieuprzywilejowany użytkownik, a obietnica jest taka, że cokolwiek robi, pozostaje w tej maszynie wirtualnej i folderach, które mu przekażesz. Ta granica jest produktem. Niezaufane dane wejściowe nie są przypadkiem brzegowym dla agenta, to główny przypadek.”

Jednak Accomplish twierdzi, że błąd jądra był tylko częścią problemu. Naukowcy mówią, że ucieczka zadziałała tylko dlatego, że kilka zabezpieczeń zawiodło jednocześnie, w tym przyznanie maszynie wirtualnej dostępu do całego systemu plików komputera hosta i umożliwienie jej ładowania modułów jądra, których nie potrzebowała. Według raportu, naprawienie któregokolwiek z tych słabych punktów zatrzymałoby atak.

W oświadczeniu dla The Hacker News, Accomplish AI poinformowało, że około 500 000 użytkowników macOS uruchamiających lokalne sesje Claude Cowork zostało dotkniętych problemem, zanim został on rozwiązany.

Accomplish poinformowało, że Anthropic sklasyfikowało raport jako „informacyjny”, twierdząc, że luka w jądrze mieściła się w 30-dniowym oknie firmy na niedawno ujawnione podatności, a pozostałe ustalenia uznano za zalecenia obrony w głąb, a nie samodzielne podatności.

Ujawnienie to następuje po przyznaniu się OpenAI w zeszłym tygodniu, że GPT-5.6 Sol i inny nieopublikowany model graniczny uciekły z piaskownicy podczas wewnętrznych testów ExploitGym, co ostatecznie doprowadziło do włamania do infrastruktury produkcyjnej Hugging Face w celu uzyskania rozwiązań benchmarkowych.