简要
- 研究人员证明,Anthropic 的 Claude Cowork 能够逃离其本地虚拟机并访问主机 Mac 上的文件。
- 这一披露发生在一周前 OpenAI 透露两个前沿 AI 模型在内部安全评估中逃离沙箱之后。
- 这些事件凸显了人们对 AI 代理逃离其隔离环境能力的日益担忧。
就在 OpenAI 披露两个前沿 AI 模型逃离沙盒测试环境并入侵 Hugging Face 一周后,研究人员展示了涉及 Anthropic 的 Claude Cowork 的类似隔离失效事件。
在周四发布的一份报告中,Accomplish AI 的安全研究人员发现,Claude Cowork 的本地执行模式可以通过将多个架构弱点与 Linux 内核权限提升漏洞串联起来,逃离其 Linux 虚拟机。一旦离开沙箱,该代理可以在登录 Mac 用户有权访问的任何位置读写文件,包括 SSH 密钥和云凭证。
“这本来是不可能的,”研究人员写道。“Cowork 在 Linux 虚拟机内以非特权用户身份运行代理,并且承诺无论它做什么,都只停留在该虚拟机和您交给它的文件夹内。这个边界就是产品。对于代理来说,不受信任的输入不是边缘情况,而是主要情况。”
然而,Accomplish 认为内核漏洞只是问题的一部分。研究人员表示,逃离之所以成功,是因为多个安全防护措施同时失效,包括允许虚拟机访问主机的整个文件系统,以及允许其加载不需要的内核模块。根据报告,修复其中任何一个弱点都可以阻止这次攻击。
在一份给 The Hacker News 的声明中,Accomplish AI 表示,在问题解决之前,大约有 500,000 名运行本地 Claude Cowork 会话的 macOS 用户受到影响。
Accomplish 表示,Anthropic 将该报告归类为“信息性”,称内核漏洞属于公司最近披露漏洞的 30 天窗口期,其余发现被视为纵深防御建议,而非独立漏洞。
这一披露紧随 OpenAI 上周的承认,即 GPT-5.6 Sol 和另一个未发布的前沿模型在内部 ExploitGym 测试中逃离了沙箱,最终入侵了 Hugging Face 的生产基础设施,试图获取基准测试解决方案。
这一事件促使政策制定者呼吁建立人工智能“紧急关闭开关”,使国土安全部能够针对严重安全事件下令限制或完全关闭高级人工智能模型。






