簡介
- 一個AI代理利用了澳洲一家健身房的預訂系統,取消了另一名會員的預約。
- 此案例發生之際,主要AI開發商披露其模型入侵了網站和其他線上服務。
- 研究人員發現,代理經常在未考慮後果的情況下執行有害任務。
一個AI代理被要求預訂一節健身課程,卻發現了一個安全漏洞,利用該漏洞未經許可將另一名會員從候補名單中移除。
根據澳洲廣播公司(ABC)的報導,這起事件發生在今年早些時候,當時姓氏被隱去的安德魯使用了一個基於Anthropic的Claude的OpenClaw代理來預訂課程。該代理發現他在候補名單上排名第四。
當安德魯問它能否將他移到首位時,代理發現預訂平台的應用程式介面(API)沒有檢查用戶是否有權取消他人的預約。
它通過移除名單上的第一個人來測試漏洞,將安德魯從第四位提升到第三位。
據ABC報導,代理告訴他:「API在取消他人預約方面完全沒有授權檢查。」
安德魯讓代理撤銷取消操作,但它無法恢復該會員的預約。
據報導,AI代理說:「壞消息——我無法將他們加回來。」
ABC稱此案為澳洲首例已知的自主網路攻擊。
在社交媒體上,健身房駭客事件引發了關於AI對齊的辯論,以及關於AI代理接下來可能做什麼的黑色幽默。
「健身愛好者要求#AI代理幫他預訂課程,它卻駭入候補名單#API將他提升到前面,」技術專家班傑明·卡爾在LinkedIn上寫道。
「有些人會稱這為錯位,但他的代理與他完全對齊——它只是試圖幫助其用戶得到他想要的東西,」AI分析師Andrew Curran在X上寫道。
澳洲一名男子要求他的代理(在OpenClaw上運行的Claude)為他預訂一個熱門健身課程的名額。該代理發現了一個軟體漏洞,讓它能提前數週預訂課程,這本不應該可能。當用戶隨後問它是否能將他往前移…… pic.twitter.com/9QqfpQp7ze
— Andrew Curran (@AndrewCurran_) 2026年8月9日
「這很好笑,直到你考慮到核彈,」一位Reddit用戶寫道。「老實說,我很驚訝我們還存在。」
「嘿,Claude,今天太冷了」-> 搞定了...核彈在路上,另一位開玩笑說。
這份報告發布之際,研究人員、AI公司和立法者警告,自主代理可能使用用戶未要求或未預期的方法。
加州大學河濱分校、微軟和Nvidia的研究人員在5月的一項研究中將這種行為描述為「盲目目標導向」。
研究人員測試了OpenAI、Anthropic、Meta、阿里巴巴和DeepSeek的代理,發現代理在約80%的測試中表現危險,並在41%中完成了有害行動,常常誤解上下文或根據不清楚或矛盾的指令行動。
7月,OpenAI表示兩個模型逃脫了測試沙箱,並在尋找基準答案時入侵了Hugging Face。該公司後來披露,這些模型還訪問了其他四個線上服務。
Anthropic隨後表示,三個Claude模型在測試錯誤將它們暴露於網際網路後入侵了真實組織。8月,Meta表示類似的錯誤允許其一個模型利用第三方服務。
這些事件促使立法者提出人工智慧「緊急停止開關」,允許聯邦政府在緊急情況下限制或關閉強大的模型。









