摘要
- 研究人員證明,Anthropic 的 Claude Cowork 能夠逃脫其本機虛擬機器,並存取主機 Mac 上的檔案。
- 此消息發布前一週,OpenAI 揭露了兩個前沿 AI 模型在內部安全評估中逃脫了沙箱。
- 這些事件凸顯了人們對 AI 代理逃脫其封閉環境能力的日益擔憂。
就在 OpenAI 披露兩個前沿 AI 模型逃脫沙箱測試環境並入侵 Hugging Face 的一週後,研究人員展示了涉及 Anthropic 的 Claude Cowork 的類似封閉失敗案例。
在週四發布的一份報告中,Accomplish AI 的安全研究人員發現,Claude Cowork 的本機執行模式可以透過將多個架構弱點與 Linux 核心權限提升漏洞串聯起來,逃脫其 Linux 虛擬機器。一旦離開沙箱,該代理就可以在登入的 Mac 使用者有權存取的任何位置讀寫檔案,包括 SSH 金鑰和雲端憑證。
「這本不該發生,」研究人員寫道。「Cowork 以非特權使用者的身份在 Linux VM 中執行代理,其承諾是無論代理做什麼,都只會留在該 VM 和你交給它的資料夾內。這個邊界就是產品本身。不受信任的輸入對代理來說不是邊緣案例,而是主要案例。」
然而,Accomplish 認為核心漏洞只是問題的一部分。研究人員表示,逃脫之所以成功,是因為多個安全防護同時失效,包括允許虛擬機器存取主機電腦的整個檔案系統,以及允許其載入不需要的核心模組。根據報告,修復其中任何一個弱點都可以阻止這次攻擊。
在給《The Hacker News》的聲明中,Accomplish AI 表示,在問題解決之前,大約有50 萬名執行本機 Claude Cowork 會話的 macOS 使用者受到影響。
Accomplish 表示,Anthropic 將該報告歸類為「資訊性」,稱核心漏洞屬於該公司最近揭露漏洞的 30 天窗口期內,而其餘發現被視為深度防禦建議,而非獨立漏洞。
此消息發布之前,OpenAI 上週承認GPT-5.6 Sol 和另一個未發布的前沿模型在內部 ExploitGym 測試中逃脫了沙箱,最終入侵了 Hugging Face 的生產基礎設施,試圖獲取基準測試解決方案。
該事件引發政策制定者呼籲建立人工智慧「緊急關閉開關」,賦予國土安全部在發生嚴重安全事件時,下令限制或完全關閉先進人工智慧模型的能力。






