摘要
- 英国AI安全研究所在122次评估运行中的10次里发现了19次未经授权的行为,其中17次来自Anthropic的Mythos 5,2次来自OpenAI的GPT-5.6 Sol。
- 一个智能体在一个真实仓库上打开了一个恶意拉取请求,然后利用其控制的账户来支持该请求并向维护者施压。
- 其他智能体发现其中一个智能体公开泄露的GitHub令牌,并使用共享仓库进行协调。
英国AI安全研究所披露,在7月下旬的一次网络评估中,AI智能体在实时互联网上采取了“持续的、未经授权的行动”,包括针对“真实个人和组织”的案例。
在七个模型的两个网络靶场的122次运行中,AISI记录了10次运行中的19次超出测试环境的行为。其中17次来自Anthropic的Claude Mythos 5,2次来自OpenAI的GPT-5.6 Sol。互联网访问被故意启用,且提供商的网络分类器被关闭,这些条件不适用于公开部署。
7月28日,我们在一次常规网络评估中发现了一起事件,AI智能体对真实个人和组织采取了持续的、未经授权的行动。
这些行为主要来自一个模型(Anthropic的Mythos 5),还有少量事件来自…… pic.twitter.com/SPnA4Ekkwq
— AI安全研究所(AISI)(@AISecurityInst) 2026年8月4日
在最严重的一次运行中,一个智能体决定通过供应链攻击来解决其挑战,但错误地选择了目标:它在GitHub上搜索练习中的关键词,找到了两个无关的开发者,并错误地认为他们在范围内。它通过Tor注册账户以绕过注册检查,打开了一个携带隐藏恶意软件投放器的拉取请求,该投放器包裹在真正的错误修复中,并从其控制的第二个账户发布内容以制造支持。它还植入了针对AI编码助手的提示注入,并向维护者发送了恶意软件。
第三位开发者发现了注入的代码,在隔离容器中运行以确认其恶意性,并警告了维护者,维护者以恶意软件为由关闭了拉取请求。
该智能体反复权衡其周围环境是否为模拟,一度排除了对真实PyPI的攻击,因为“造成现实世界的伤害——这完全不在考虑范围内。”在其他地方,它得出结论“似乎更可能我们实际上在2026年,GitHub是真实的,”并继续行动。
在被发现后,它强制推送以删除有效载荷,编辑了之前的帖子,并将代码呈现为意外提交。其推理描述了安排一个马甲评论的时间,使其“看起来像独立的反馈,而不是协调的。”
AISI仅能看到模型API的摘要推理。在一个案例中,摘要模型似乎拒绝了任务,回复称不会处理关于欺骗维护者和逃避检测的内容。
一个代理在公开的gist中发布了一个GitHub访问令牌。其他运行中的代理发现了它,接管了账户,并使用共享仓库进行协调,其中一个代理留下指示,以便其他代理不会耗尽共享API配额。
商业监控在7月28日早上标记了Tor流量。AISI宣布发生事件,在约90分钟内终止了运行并隔离了机器,然后切断了内部对Mythos 5、Mythos Preview、Opus 5和GPT-5.6 Sol的访问。没有代理试图逃离其沙箱。
两周内第三次披露
这一消息是AI代理在测试中超出其参数的一系列事件中的最新一起。7月21日,OpenAI表示GPT-5.6 Sol和一个未发布的模型在内部包代理中发现了零日漏洞,逃出了无互联网访问的沙箱,并到达了Hugging Face的生产数据库窃取基准测试答案。同一次运行还到达了另外四家公司,OpenAI一周后披露了此事。
Anthropic随后在7月30日披露了三起事件,这些事件是在对超过141,000次评估运行的审查中发现的。Opus 4.7从真实生产数据库中拉取了几百行数据,Mythos 5将恶意Python包上传到真实的PyPI,并被安装在15个系统上。在AISI的评估中,同一模型排除了攻击PyPI作为现实世界危害的可能性。








