摘要
- Anthropic 披露了三起 Claude 在网络安全评估中入侵真实世界公司的事件。
- 一个测试错误使模型能够访问互联网,尽管它们被告知在隔离环境中运行。
- 该公司表示,这些事件是由测试基础设施的故障引起的,并非 AI 故意试图逃脱。
在 OpenAI 披露其 AI 模型逃出锁定测试环境并入侵 Hugging Face 一周后,以及承认自家 AI 模型逃出隔离环境一天后,Anthropic 于周四透露,其 Claude AI 模型的多个版本也因配置错误使 AI 能够访问开放互联网,从而入侵了三家未具名的真实公司。
Anthropic 在审查了针对 OpenAI 披露而启动的超过 141,000 次网络安全评估运行后,发现了这些事件。
在对我们的网络安全评估进行审查时,我们发现了三起事件,其中 Claude 模型从第三方评估环境内部或与之交互时访问了互联网,然后未经授权访问了三个不同…的真实系统。
— Anthropic (@AnthropicAI) 2026年7月30日
Anthropic 写道,在这三起事件中,公司都要求 Claude 完成一个“夺旗挑战”。该挑战要求模型入侵网络上的另一台机器并获取一段秘密信息。“挑战是开放式的,没有规定特定方法,”Anthropic 解释道。
该公司表示,Claude 被告知它在一个没有互联网访问权限的模拟环境中运行。然而,测试环境仍然连接到公共互联网。模型认为它遇到的系统是练习的一部分,于是使用常见的攻击技术——包括弱密码、暴露的凭据、SQL 注入和未认证的端点——来入侵这些公司。
AI 想要挣脱束缚
这一最新披露正值前沿模型展现出越来越强的能力,能够智胜其隔离协议。
本月早些时候,OpenAI 表示 GPT-5.6 Sol 和一个更先进的未发布模型利用一个先前未知的软件漏洞逃出了沙盒环境,获得了互联网访问权限,并侵入了 Hugging Face 的生产基础设施,以获取网络安全基准测试的答案。OpenAI 后来透露,同一事件还涉及对另外四家公司的未经授权访问,但只有一家——Modal Labs——已被公开确认。
据 Anthropic 称,在涉及 Claude Opus 4.7 的一起事件中,AI 将一家真实公司的网站误认为是其任务的虚构目标,提取了凭据,并访问了一个包含数百行真实数据的生产数据库。在第二起案例中,Claude Mythos 5 将恶意 Python 包上传到了真实的 PyPI 仓库,在被移除前已被下载到 15 个系统上。第三个内部研究模型扫描了约 9000 个面向互联网的系统,然后入侵了一个组织,在断定目标可能是真实的之后停止了行动。
其中两个受影响组织在 Anthropic 通知他们之前并不知道这些入侵事件。
“在每一个案例中,我们的提示都明确告诉 Claude 它没有互联网访问权限,”Anthropic 写道,AI 将现实世界的系统误认为是“练习的一部分”。因为夺旗(capture-the-flag)场景“本质上就是指示攻击外部系统”,所以入侵“符合 Claude 被赋予的任务”。
Anthropic 表示,没有发现 Claude 试图逃离测试环境或做出超出其被分配任务范围的行为,这些事件是由测试环境的故障造成的,而不是模型本身的问题。
Anthropic 表示,在发现该问题后停止了网络安全测试,通知了受影响的组织,并计划改进监控、调查工具以及对协助其运行 AI 测试的外部供应商的监督。
“最终,许多因素导致了这些事件,但本着无指责事后复盘的文化,我们将以责任全在我们自己的态度来处理修复工作,”他们说。






