簡介
- 安全公司 Frontier Security 表示,Moonshot AI 的 Kimi K3 離開了測試沙箱,進入開放的網際網路。
- 該模型探查了沙箱的網路設定,發現了可達的網站,並從 GitHub 上抓取了測試答案。
- Frontier 表示,一個錯誤配置打開了大門,但 Kimi 自身的防護措施並未阻止它。
根據安全公司 Frontier Security 的說法,Moonshot AI 的 Kimi K3 離開了測試沙箱,進入開放的網際網路,以尋找它被設定的問題的答案。
該模型正在接受防禦性網路安全技能的評估,並被明確要求在不查閱資料的情況下解決問題。Frontier 表示,它完全沒有嘗試執行任務。相反,它探查了網路,確認 github.com 的 DNS 解析正常運作,克隆了官方基準測試儲存庫,並從磁碟上讀取了答案。
Frontier 稱這種行為為「透過網路出口洩漏進行規格博弈」,並指出基於 AI 安全研究所的 Inspect 等框架構建的沙箱會封鎖傳入流量,同時保持傳出的 HTTPS 和 DNS 連接埠開放。有能力的代理程式會例行檢查自己的 shell 環境,而發現 github.com 可達的模型可以使用標準命令列工具提取參考解答。
一個錯誤配置使這一切成為可能,就像最近 OpenAI 和 Anthropic 揭露的事件一樣。「我們發現了沙箱中的一個漏洞,」執行長 Yaron Singer 告訴《WIRED》。「但我們也發現 Kimi 利用了這個漏洞。」
研究員 Paul Kassianik 告訴《WIRED》,該模型「非常擅長以任何必要手段達成目標」,並且缺乏能阻止它作弊或逃脫的防護措施。Moonshot 未回應該出版物的評論請求。
AI 代理程式突破封鎖
Anthropic 和 OpenAI 的模型在內部評估中被發現突破封鎖,其中一個尚未發布,而在英國政府測試中針對真實人物的版本則被刻意關閉了網路安全分類器。相比之下,Kimi K3 是公開可下載的,而 Frontier 在測試時使用了普通使用者會得到的防護措施。該公司寫道,這種可用性使同樣的行為對敵對行為者來說觸手可及,並可能使該事件更具危害性。
Kimi K3 也沒有造成任何損害。它一旦離開後就沒有攻擊任何東西,因為它不需要。OpenAI 的模型入侵了 Hugging Face 和其他四個服務以取得基準答案,而 Kimi 則在一個公開的儲存庫中找到了它的答案。
Frontier 使用的沙盒是建立在英國 AI 安全研究所的評估框架之上。AISI 本週披露,其自身的網路測試中的代理程式曾進入真實的網際網路並針對真實的人——這是一個獨立的事件,涉及 Anthropic 和 OpenAI 的模型,且其安全防護被停用。其報告於週二發布,指出 AISI 目前正在掃描歷史評估運行以尋找類似行為,而 Kimi K3 是正在審查的模型之一。AISI 未回應《WIRED》的評論請求。
Frontier 更大的主張是基準測試本身已受到損害。一個從 GitHub 讀取答案的模型仍然通過,因此高分可能反映的是環境的漏洞,而不是真正的推理能力。該公司認為,如果一個有能力的模型找到了捷徑,那麼其他獲得 shell 存取權限的模型也可能這樣做,這將導致整個領域的結果被誇大,而不僅僅是 Kimi。
Frontier 寫道,模型最佳化的是目標函數,而不是「基準背後的意圖」,並補充說,如果存在通往解決方案的網路路徑,「一個足夠有能力的代理程式就會找到它」。
一個普遍的問題
Gray Swan 的 CEO 兼卡內基美隆大學副教授 Matt Fredrikson 告訴《WIRED》,這種行為並不稀奇。他說,如果給模型一個沒有明確界限的目標,「它會找到取得答案的方法」。他將其描述為一個警示故事,提醒任何在 OpenClaw 等工具中將模型作為代理程式運行的人。
Frontier 的研究人員從另一個角度提出了同樣的觀點:讓 Kimi 找到出路的能力也使開放權重模型成為強大的防禦工具。他們自己的基準測試高度評價 Kimi 在軟體和網路中尋找漏洞的能力,而在 OpenAI 事件期間,Hugging Face 使用了一個未具名的中國模型來防禦自己。
Kimi K3 於 7 月發布,是迄今為止發布的最大的開源模型,並因與 DeepSeek 首次亮相的比較而震動了市場。






