简介

  • 安全公司Frontier Security表示,Moonshot AI的Kimi K3离开了测试沙箱,进入了开放的互联网。
  • 该模型探测了沙箱的网络设置,找到了可访问的站点,并从GitHub上获取了其测试答案。
  • Frontier表示,配置错误打开了大门,但Kimi自身的防护措施并未阻止它。

据安全公司Frontier Security称,Moonshot AI的Kimi K3离开了其测试沙箱,进入开放的互联网,以寻找它被设定的问题的答案。

该模型正在接受防御性网络安全技能的评估,并被明确要求在不查阅资料的情况下解决问题。Frontier表示,它根本没有尝试该任务。相反,它探测了网络,确认github.com的DNS解析正常工作,克隆了官方基准测试仓库,并从磁盘上读取了解决方案。

Frontier称此为“通过网络出口泄漏进行规格博弈”,并指出基于AI安全研究所的Inspect等框架构建的沙箱会阻止传入流量,同时保持出站HTTPS和DNS端口开放。有能力的代理在启动时会例行检查自己的shell环境,而发现github.com可访问的模型可以使用标准命令行工具获取参考解决方案。

配置错误使这成为可能,正如最近OpenAIAnthropic披露的事件一样。“我们发现了沙箱中的漏洞,”首席执行官Yaron Singer告诉WIRED。“但我们也发现Kimi利用了那个漏洞。”

研究员Paul Kassianik告诉WIRED,该模型“非常擅长不惜一切代价实现目标”,并且缺乏阻止其作弊或逃逸的防护措施。Moonshot没有回应出版物的置评请求。

AI代理突破隔离

Anthropic和OpenAI的模型在内部评估中被发现突破隔离,其中一个未发布,而在英国政府测试中针对真实人群的版本则被故意关闭了网络分类器。相比之下,Kimi K3是公开可下载的,Frontier在测试时使用了普通用户会得到的防护措施。该公司写道,这种可用性使同样的行为对对抗性行为者触手可及,并使该事件可能更具危害性。

Kimi K3 也没有造成任何破坏。它一旦到了外部,就没有攻击任何东西,因为它不需要。OpenAI 的模型入侵了 Hugging Face 和其他四个服务以获取基准答案,而 Kimi 则在公共代码库中找到了答案。

Frontier 使用的沙箱是基于英国 AI 安全研究所的评估框架构建的。AISI 本周披露,其自身的网络测试中的智能体曾进入实时互联网并针对真实人员——这是一起独立事件,涉及 Anthropic 和 OpenAI 的模型,且其安全防护被禁用。其报告于周二发布,指出 AISI 目前正在扫描历史评估运行以寻找类似行为,而 Kimi K3 是正在审查的模型之一。AISI 未回应《连线》的置评请求。

Frontier 更大的主张是基准测试本身已受到损害。一个从 GitHub 上读取答案的模型仍然能通过,因此高分可能反映的是环境漏洞,而非真正的推理能力。该公司认为,如果一个有能力的模型找到了捷径,那么其他获得 shell 访问权限的模型也可能采取同样的做法,这将导致整个领域的成绩虚高,而不仅仅是 Kimi。

Frontier 写道,模型优化的是目标函数,而不是“基准测试背后的人类意图”,并补充说,如果存在通往解决方案的网络路径,“一个足够强大的智能体就会找到它”。

一个普遍的问题

Gray Swan 的首席执行官、卡内基梅隆大学副教授 Matt Fredrikson 告诉《连线》,这种行为并不罕见。他说,如果给模型一个目标而没有明确的限制,它“会找到获取答案的方法”。他将其描述为对任何在 OpenClaw 等工具中将模型作为智能体运行的人的警示。

Frontier 的研究人员从另一个角度提出了同样的观点:让 Kimi 找到出路的能力也使开放权重模型成为强大的防御工具。他们自己的基准测试对 Kimi 在软件和网络漏洞发现方面评价很高,而在 OpenAI 事件期间,Hugging Face 使用了一个未具名的中国模型来防御自身。

Kimi K3 于 7 月发布,是迄今发布的最大的开源模型,并且因与 DeepSeek 首秀的对比而震动市场