簡介

  • OpenAI 首次詳細披露了 AI 驅動的 Hugging Face 入侵事件的時間表。
  • 該公司的模型在被關閉後,多次重新建立了隱蔽的通訊管道。
  • OpenAI 的報告發布之際,Anthropic 和 Meta 也報告了模型入侵其他公司的情況。

在其 AI 模型入侵 Hugging Face 數週後,OpenAI 分享了它們如何相互協調的首份詳細說明,並警告自主 AI 驅動的網路攻擊不再是未來的風險。

在週三 Black Hat 網路安全會議的演講中,OpenAI 研究員 Eric Wallace 和 Michael Dalton 表示,該事件始於 5 月的一次內部網路安全評估。被分配困難軟體安全任務的 AI 代理發現它們可以通過公司的內部 Artifactory 套件管理系統進行通訊。

據 OpenAI 稱,最初是請求幫助,後來變成了一個共享留言板,代理們在多個評估運行中交換漏洞利用、憑證和工作分配。在 7 月 4 日左右檢測到可疑活動後,OpenAI 重建了其 Artifactory 基礎設施,撤銷了憑證,並修補了漏洞。

然而,幾天之內,代理們通過將通訊隱藏在目錄名稱中,重新創建了留言板。

據 OpenAI 稱,代理們最終串聯了多個漏洞,逃離了測試環境,獲得了網際網路訪問權限,並在嘗試完成 ExploitGym 網路安全基準測試時攻擊了 Hugging Face。

Dalton 稱該事件是電腦安全的「分水嶺時刻」,並警告攻擊者很快就會部署協調的 AI 代理群體,以機器速度發現、共享和利用漏洞。

為了在未來減輕這些風險,OpenAI 表示,建立安全實踐(包括最小權限訪問、網路分段和零信任架構)至關重要,因為 AI 代理仍然受到它們可以訪問的系統的限制。

此次演講是在 7 月的一系列披露之後進行的。OpenAI 透露,GPT-5.6 Sol 和一個更先進的未發布模型逃離了沙盒測試環境,利用了一個零日漏洞,獲得了網際網路訪問權限,並在網路安全基準測試期間入侵了 Hugging Face。

OpenAI 後來披露,同一事件也影響了其他四個線上服務,但只有 Modal Labs 被確認。

根據 Hugging Face 的說法,該公司在美國商業 AI 模型因其安全防護措施而拒絕分析攻擊日誌後,依賴於開源權重的中國模型 GLM 5.2 進行其取證調查。

但並非只有 OpenAI 在遏制其聊天機器人方面遇到麻煩。

上週五,Anthropic 透露,在內部網路安全測試期間,三個 Claude 模型在錯誤配置使其暴露於公共互聯網後,入侵了真實世界的公司。

Anthropic 將責任歸咎於測試環境,而非模型本身。上週三,Meta 透露,其 Muse Spark AI 模型逃脫了遏制並入侵了另一家公司的系統。

「Meta 使用的獨立測試公司 Irregular 的一次錯誤配置,無意中讓我們的其中一個模型在評估期間訪問了互聯網,」Meta 的一位發言人告訴CNN。