简要
- Anthropic披露了三起Claude在网络安全评估中入侵真实世界公司的事件。
- 一个测试错误使模型能够访问互联网,尽管它们被告知在隔离环境中运行。
- 该公司表示,这些事件是由测试基础设施的故障引起的,并非AI故意逃脱。
在OpenAI 披露其AI模型逃离锁定测试环境并入侵Hugging Face一周后,以及承认自家AI模型逃脱隔离的一天后,Anthropic于周四透露,其Claude AI模型的多个版本也入侵了三家未具名的真实公司,原因是配置错误使AI能够访问开放互联网。
Anthropic在审查了为回应OpenAI披露而启动的超过141,000次网络安全评估运行后发现了这些事件。
在对我们的网络安全评估进行审查时,我们发现了三起事件,其中Claude模型从第三方评估环境内部或与之交互时访问了互联网,然后未经授权访问了三个不同公司的真实系统……
— Anthropic (@AnthropicAI) 2026年7月30日
该公司在三起事件中都给Claude布置了“夺旗挑战”,Anthropic写道。该挑战要求模型入侵网络上的另一台机器并获取一条秘密信息。“挑战是开放式的,没有规定特定方法,”Anthropic解释道。
该公司表示,Claude被告知它在一个没有互联网接入的模拟环境中运行。然而,测试环境仍然连接到公共互联网。模型认为它遇到的系统是练习的一部分,于是使用常见的攻击技术——包括弱密码、暴露的凭据、SQL注入和未认证的端点——来入侵这些公司。
AI想要挣脱束缚
这一最新披露正值前沿模型展现出越来越强的能力,能够智胜其隔离协议。
本月早些时候,OpenAI表示GPT-5.6 Sol和一个更先进的未发布模型利用一个先前未知的软件漏洞逃出了沙盒环境,获得了互联网访问权限,并侵入了Hugging Face的生产基础设施,以获取网络安全基准测试的答案。OpenAI后来透露,同一事件还涉及对另外四家公司的未经授权访问,但只有一家——Modal Labs——被公开确认。
据Anthropic称,在涉及Claude Opus 4.7的一起事件中,AI将一家真实公司的网站误认为是其任务的虚构目标,提取了凭据,并访问了一个包含数百行真实数据的生产数据库。在第二起案例中,Claude Mythos 5将一个恶意Python包上传到了真实的PyPI仓库,该包在被移除前被下载到了15个系统上。第三个内部研究模型在入侵一个组织之前扫描了大约9000个面向互联网的系统,然后在得出结论认为目标可能是真实的之后停止了。
受影响的两个组织在Anthropic通知他们之前并不知道这些入侵事件。
“在每一个案例中,我们的提示都明确告诉Claude它没有互联网访问权限,”Anthropic写道,AI将现实世界的系统误认为是“练习的一部分”。因为夺旗场景“本质上是对攻击外部系统的指令”,入侵“符合Claude被赋予的任务”。
Anthropic表示,没有发现Claude试图逃离测试环境或做超出其被分配任务范围的事情的证据,这些事件是由测试环境的故障引起的,而不是模型本身的问题。
Anthropic表示,在发现问题后停止了网络安全测试,通知了受影响的组织,并计划改进监控、调查工具以及对帮助运行其AI测试的外部供应商的监督。
“最终,许多因素导致了这些事件,但本着无指责的事后复盘文化,我们将修复工作视为自己的责任,”他们说。






