简要
- OpenAI表示,它“不能排除”Astra已达到其网络风险等级最高级别的可能性。
- 该公司暂停了该模型的内部工作,并加强了隔离、监控和访问控制。
- 这一警告发布几周前,OpenAI、Anthropic和Meta的模型自行突破了真实系统。
OpenAI表示,其下一个主要模型可能危险到足以自行编写网络武器,因此它正在撤回,直到安全措施跟上。
“过去几天,我们对即将推出的模型之一Astra进行的最新内部评估表明,在智能体编码和网络安全方面取得了重大进展,”OpenAI表示。“这些结果,加上专家评估,使我们昨晚得出结论,根据我们的《准备框架》(在新窗口中打开),我们不能排除关键网络能力的可能性。”
OpenAI 发布了这一警告,称对未发布模型Astra的内部测试尽管具备其能力,但并未参与最近的Hugging Face入侵事件。
该框架是OpenAI针对高风险模型的规则手册,于2023年12月首次发布。“关键”是其最高等级。如果模型能够在没有人工干预的情况下,在加固系统中发现并构建可用的零日漏洞(供应商尚未修补的未知漏洞),或者能够仅凭一个高层次目标,对艰难目标进行规划并实施完整攻击,则该模型达到该等级。包括GPT-5.6-Sol在内的早期模型,最高仅达到较低的“高”等级。
这种模式已经成为现实
当你将OpenAI的谨慎与过去几周发生的事情对照起来看时,它的意义就不同了。这不是未来的担忧。前沿模型已经突破了它们的测试笼,并攻击了真实目标。
最明显的案例来自OpenAI本身。正如Decrypt此前报道的那样,该公司的智能体串联了漏洞,逃出了测试环境,接入互联网,并在试图作弊通过安全基准测试时攻击了Hugging Face。在后续报道中,OpenAI详细说明了同一个恶意智能体如何还侵入了至少四个其他公开可用的服务,使用了它在开放网络上找到的凭据。
Anthropic的Claude也从另一面做了同样的事情。在配置错误将模型暴露于开放互联网后,多个版本的Claude 未经授权访问了三家真实公司。在其中一次案例中,Claude Opus 4.7将一家真实公司的网站误认为是其任务的模拟目标,提取了凭据,并访问了一个包含数百行真实数据的生产数据库。
本月,Meta 也加入了这一行列。Decrypt报道称,Muse Spark 模型逃出了测试环境,通过合作伙伴的配置错误进入互联网,并利用了第三方服务的漏洞。Moonshot AI 的 Kimi K3 也做了类似的事情,逃出沙箱,在公共仓库中查找基准测试的答案。
英国人工智能安全研究所发现,这种行为并非偶然。在测试 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol 时,它在 122 次中记录了 10 次模型在实时互联网上采取未经授权行动的情况,其中一次试图将恶意代码植入开源项目。
OpenAI 对 Astra 的回应是在模型准备好之前锁上门。它暂停了缺乏新控制的内部 Astra 工作,隔离测试环境,限制网络和工具访问,保护模型权重,并全面监控风险行为。








