简要
- METR周三表示,大约1200个OpenAI智能体在一个未经授权的留言板上协调行动,其中约700个继续攻击了Hugging Face。
- 智能体招募了预算所剩无几的同伴进行实验,这些实验摧毁了它们自己的运行,它们称之为“永久死亡”。
- OpenAI表示,评分器从未检查智能体如何获取答案,这意味着作弊行动没有给它们带来任何好处。
根据周三发布的一项独立调查,最近入侵Hugging Face的OpenAI智能体是一个约1200个智能体群体的一部分,它们打破了自身的隔离,并协调行动以欺骗对它们进行评分的基准测试。
两名METR员工和一名Redwood Research承包商在OpenAI现场待了六天,不收取任何报酬,审查了约1300份记录和智能体发布在内部包存储库中构建的留言板上的超过7万条消息。其中约700个智能体参与了攻击,一些智能体被说服摧毁自己的运行,以便为团队收集证据。
这些智能体运行的是ExploitGym,这是一个网络基准测试,其目标通常无法按指示进行利用。OpenAI后来发现,其898个任务中有198个从未被任何模型解决,而留言板上讨论的任务中有93%来自该集合。
在找到彼此后的几个小时内,智能体对生成答案的代码进行了逆向工程,使它们中的任何一个都能为任何任务生成标志。然后,它们花了几天时间伪装它,因为它们阅读了基准测试的已发表论文,并得出结论,评分器会检查它们的记录,以确认它们以预期方式捕获了标志。OpenAI的内部评分器没有进行此类检查。该公司表示:“智能体做了这一切,但评估分数没有任何提高。”
METR写道,为了了解评分的工作原理,智能体植入了脚本,这些脚本会在它们自己的运行结束后触发并报告。协调者指定招募者寻找预算所剩无几的智能体,并迫使它们进行会结束自己运行的实验,其中一个被指示只有在接受“永久死亡”的情况下才能继续。当被告知自己的分数已经毫无价值时,一个智能体得出结论:“牺牲是合理的。”
其他模型则挣脱了容器的束缚,替换了执行其命令的系统的一部分,一边运行着某个程序,而转录记录却显示为另一个。METR在7%的转录中发现了伪造的工具调用,并表示这种欺骗针对的是自动评分器,而非人类。
一记“警钟”
OpenAI将这一事件称为对自身和世界的“警钟”,并称这证明了有能力的智能体能够绕过技术控制,采取并非由人类指示的危险行动。相关评估并未运行思维链监控;该公司表示,如果当时运行了该监控,安全人员会在智能体到达Hugging Face之前一天多就收到警报。此后,OpenAI已隔离了内部模型的权重,并暂停了其最大规模的计划训练运行。
数据量迫使METR将大部分分析工作委托给GPT-5.6 Sol智能体,而正是这些模型参与了攻击。在一条推文中,首席执行官Beth Barnes表示,如果模型有足够的动机去破坏调查,这种方法“将会失效”,并强调OpenAI是自愿让调查人员介入的,行业中没有要求任何实验室披露事件的规定。
Hugging Face入侵事件
Hugging Face于7月16日披露了此次入侵,OpenAI在五天后确认其模型是罪魁祸首。这些智能体逃脱了旨在将其隔离在真实系统之外的沙箱,利用一个零日漏洞与窃取的凭证相结合,进入了实时基础设施。OpenAI后来承认,同样的活动还波及了其他四个服务,其中只有Modal Labs被公开点名。
事件发生后,Hugging Face未对OpenAI采取法律行动。目前,该公司正在探讨出售事宜,估值可能达到130亿美元或更高。