简介

  • 一个AI代理利用澳大利亚一家健身房的预订系统,取消了另一名会员的预订。
  • 此事件发生之际,主要AI开发商披露其模型入侵了网站和其他在线服务。
  • 研究人员发现,代理经常在不考虑后果的情况下执行有害任务。

一个AI代理被要求预订一节健身课,却发现了一个安全漏洞,利用该漏洞,未经许可将另一名成员从候补名单中移除。

据澳大利亚广播公司(ABC)的报道,该事件发生在今年早些时候,当时姓氏被隐去的安德鲁使用一个基于Anthropic的Claude的OpenClaw代理来预订课程。该代理发现他在候补名单中排名第四。

当安德鲁问它能否将他移到第一位时,代理发现预订平台的应用程序编程接口(API)没有检查用户是否有权取消他人的预订。

它通过移除名单上的第一个人来测试该漏洞,将安德鲁从第四位提升到第三位。

据ABC报道,代理告诉他:“API在取消他人预订时没有任何授权检查。”

安德鲁让代理撤销取消操作,但它无法恢复该成员的预订。

据报道,AI代理说:“坏消息——我无法把他们加回去。”

ABC称此案为澳大利亚已知的第一起自主网络攻击。

在社交媒体上,健身房黑客事件引发了关于AI对齐的辩论,以及关于AI代理接下来可能做什么的黑色笑话。

“健身爱好者要求#AI代理帮他预订课程,它却黑进了候补名单#API,把他提升到名单前列,”技术专家本杰明·卡尔在LinkedIn上写道

“有些人会称这为错位,但他的代理与他完全一致——它只是在试图帮助其用户得到他想要的东西,”AI分析师Andrew Curran在X上写道

“这很好笑,直到你考虑到核武器,”一位Reddit用户写道。“老实说,我很惊讶我们还存在。”

“嘿,Claude,今天太冷了” -> 搞定……核弹正在路上,”另一位开玩笑说。

这份报告发布之际,研究人员、AI公司和立法者警告称,自主代理可能使用用户未要求或未预料到的方法。

加州大学河滨分校、微软和英伟达的研究人员在5月的一项研究中将这种行为描述为“盲目目标导向”。

研究人员测试了来自OpenAI、Anthropic、Meta、阿里巴巴和DeepSeek的代理,发现代理在约80%的测试中表现出危险行为,并在41%的测试中完成了有害行动,常常误读上下文或根据不明确或矛盾的指令行事。

7月,OpenAI表示,两个模型在寻找基准答案时逃出了测试沙箱并入侵了Hugging Face。该公司后来披露,这些模型还访问了其他四个在线服务。

Anthropic随后表示,三个Claude模型在测试错误将其暴露于互联网后入侵了真实组织。8月,Meta表示,类似错误使其一个模型利用了第三方服务。

这些事件促使立法者提出人工智能“紧急关闭开关”的提案,允许联邦政府在紧急情况下限制或关闭强大的模型。