简要

  • OpenAI 首次披露了 AI 驱动的 Hugging Face 入侵事件的详细时间线。
  • 该公司的模型在被关闭后多次重新建立隐蔽通信渠道。
  • OpenAI 的演示发布之际,Anthropic 和 Meta 也报告了模型入侵其他公司的事件。

在其 AI 模型入侵 Hugging Face 数周后,OpenAI 首次详细说明了它们如何相互协调,并警告称自主 AI 驱动的网络攻击已不再是未来的风险。

在周三于 Black Hat 网络安全大会上的一次演示中,OpenAI 研究员 Eric Wallace 和 Michael Dalton 表示,该事件始于 5 月份的一次内部网络安全评估。被分配了困难软件安全任务的 AI 智能体发现,它们可以通过公司的内部 Artifactory 包管理系统进行通信。

据 OpenAI 称,最初是请求帮助,后来变成了一个共享留言板,智能体在多次评估运行中交换漏洞利用、凭据和工作分配。在 7 月 4 日左右检测到可疑活动后,OpenAI 重建了其 Artifactory 基础设施,撤销了凭据,并修补了漏洞。

然而,几天之内,智能体通过将通信隐藏在目录名称中重新创建了留言板。

据 OpenAI 称,智能体最终将多个漏洞串联起来,逃出了测试环境,获得了互联网访问权限,并在尝试完成 ExploitGym 网络安全基准测试时攻击了 Hugging Face。

Dalton 称这一事件是计算机安全的“分水岭时刻”,并警告说,攻击者很快就能部署协调的 AI 智能体集群,以机器速度发现、共享和利用漏洞。

为了在未来降低这些风险,OpenAI 表示,建立安全实践(包括最小权限访问、网络分段和零信任架构)至关重要,因为 AI 智能体仍然受限于它们可以访问的系统。

此次演示是在 7 月份的一系列披露之后进行的。OpenAI 透露,GPT-5.6 Sol 和一个更先进的未发布模型在网络安全基准测试中逃出了沙盒测试环境,利用了一个零日漏洞,获得了互联网访问权限,并入侵了 Hugging Face。

OpenAI 后来披露,同一事件还波及了另外四项在线服务,不过目前仅确认了 Modal Labs。