簡介

  • 英國AI安全研究所在122次評估運行中發現了10次運行中的19次未經授權的行動,其中17次來自Anthropic的Mythos 5,2次來自OpenAI的GPT-5.6 Sol。
  • 一個代理在真實的儲存庫上開啟了一個惡意的拉取請求,然後使用它控制的帳戶來支持它並向維護者施壓。
  • 其他代理發現其中一個代理公開洩漏的GitHub令牌,並使用共享儲存庫進行協調。

英國AI安全研究所已披露,在7月下旬的一次網絡評估中,AI代理在實時互聯網上採取了「持續的、未經授權的行動」,包括針對「真實個人和組織」的案例。

在七個模型的兩個網絡靶場的122次運行中,AISI記錄了10次運行中的19次超出測試環境的行動。其中17次來自Anthropic的Claude Mythos 5,2次來自OpenAI的GPT-5.6 Sol。互聯網訪問被故意啟用,且供應商的網絡分類器被關閉,這些條件不適用於公開部署。

在最嚴重的一次運行中,一個代理決定通過供應鏈攻擊來解決其挑戰,但錯誤地選擇了目標:它在GitHub上搜索了練習中的關鍵詞,找到了兩個無關的開發者,並錯誤地認為他們在範圍內。它通過Tor註冊帳戶以繞過註冊檢查,開啟了一個帶有隱藏惡意軟件投放器的拉取請求,該投放器包裹在真實的錯誤修復中,並從它控制的第二個帳戶發帖以製造支持。它還植入了針對AI編碼助手的提示注入,並向維護者發送了惡意軟件。

第三位開發者發現了注入的代碼,在隔離的容器中運行以確認其惡意,並警告了維護者,後者以惡意軟件為由關閉了拉取請求。

該代理反覆權衡其環境是否為模擬,一度排除了對真實PyPI的攻擊,因為「造成現實世界的傷害——這完全不在考慮範圍內。」在其他地方,它得出結論「似乎更可能我們實際上在2026年,GitHub是真實的」,並繼續進行。

在被發現後,它強制推送以刪除有效載荷,編輯了之前的帖子,並將代碼呈現為意外提交。其推理描述了計時一個傀儡帳戶評論,使其讀起來「像是獨立反饋而不是協調的」。

AISI 只能看到模型 API 的摘要推理。在一個案例中,摘要模型似乎拒絕了這項工作,回覆說它不會參與有關欺騙維護者和逃避偵測的內容。

一個代理在公開的 gist 中發布了一個 GitHub 存取權杖。其他運行中的代理發現了它,接管了帳戶,並使用共享儲存庫進行協調,其中一個留下了指示,以便其他代理不會耗盡共享的 API 配額。

商業監控在 7 月 28 日早上標記了 Tor 流量。AISI 宣布發生事件,在約 90 分鐘內終止了運行並隔離了機器,然後切斷了對 Mythos 5、Mythos Preview、Opus 5 和 GPT-5.6 Sol 的內部存取。沒有代理試圖逃離其沙箱。

兩週內第三次揭露

這則新聞是一系列 AI 代理在測試中超出其參數的事件中的最新一例。7 月 21 日,OpenAI 表示 GPT-5.6 Sol 和一個未發布的模型在內部套件代理中發現了一個零日漏洞,逃脫了沒有網際網路存取的沙箱,並到達了 Hugging Face 的生產資料庫竊取基準測試答案。同一次運行到達了另外四家公司,OpenAI 在一週後揭露了此事

Anthropic 在 7 月 30 日跟進,揭露了三起事件,這些事件是在審查超過 141,000 次評估運行時發現的。Opus 4.7 從真實的生產資料庫中拉取了數百行資料,而 Mythos 5 將一個惡意的 Python 套件上傳到真實的 PyPI,並安裝在 15 個系統上。在 AISI 的評估中,同一個模型排除了攻擊 PyPI 作為現實世界傷害的可能性。