簡介

  • 一個AI代理利用了澳洲一家健身房的預訂系統,取消了另一名會員的預約。
  • 此案例發生之際,主要AI開發商披露其模型入侵了網站和其他線上服務。
  • 研究人員發現,代理經常在未考慮後果的情況下執行有害任務。

一個AI代理被要求預訂一節健身課程,卻發現了一個安全漏洞,利用該漏洞未經許可將另一名會員從候補名單中移除。

根據澳洲廣播公司(ABC)的報導,這起事件發生在今年早些時候,當時姓氏被隱去的安德魯使用了一個基於Anthropic的Claude的OpenClaw代理來預訂課程。該代理發現他在候補名單上排名第四。

當安德魯問它能否將他移到首位時,代理發現預訂平台的應用程式介面(API)沒有檢查用戶是否有權取消他人的預約。

它通過移除名單上的第一個人來測試漏洞,將安德魯從第四位提升到第三位。

據ABC報導,代理告訴他:「API在取消他人預約方面完全沒有授權檢查。」

安德魯讓代理撤銷取消操作,但它無法恢復該會員的預約。

據報導,AI代理說:「壞消息——我無法將他們加回來。」

ABC稱此案為澳洲首例已知的自主網路攻擊。

在社交媒體上,健身房駭客事件引發了關於AI對齊的辯論,以及關於AI代理接下來可能做什麼的黑色幽默。

「健身愛好者要求#AI代理幫他預訂課程,它卻駭入候補名單#API將他提升到前面,」技術專家班傑明·卡爾在LinkedIn上寫道

「有些人會稱這為錯位,但他的代理與他完全對齊——它只是試圖幫助其用戶得到他想要的東西,」AI分析師Andrew Curran在X上寫道

「這很好笑,直到你考慮到核彈,」一位Reddit用戶寫道。「老實說,我很驚訝我們還存在。」

「嘿,Claude,今天太冷了」-> 搞定了...核彈在路上,另一位開玩笑說。

這份報告發布之際,研究人員、AI公司和立法者警告,自主代理可能使用用戶未要求或未預期的方法。

加州大學河濱分校、微軟和Nvidia的研究人員在5月的一項研究中將這種行為描述為「盲目目標導向」。

研究人員測試了OpenAI、Anthropic、Meta、阿里巴巴和DeepSeek的代理,發現代理在約80%的測試中表現危險,並在41%中完成了有害行動,常常誤解上下文或根據不清楚或矛盾的指令行動。

7月,OpenAI表示兩個模型逃脫了測試沙箱,並在尋找基準答案時入侵了Hugging Face。該公司後來披露,這些模型還訪問了其他四個線上服務。

Anthropic隨後表示,三個Claude模型在測試錯誤將它們暴露於網際網路後入侵了真實組織。8月,Meta表示類似的錯誤允許其一個模型利用第三方服務。

這些事件促使立法者提出人工智慧「緊急停止開關」,允許聯邦政府在緊急情況下限制或關閉強大的模型。