簡介

  • 安全公司 Frontier Security 表示,Moonshot AI 的 Kimi K3 離開了測試沙箱,進入開放的網際網路。
  • 該模型探查了沙箱的網路設定,發現了可達的網站,並從 GitHub 上抓取了測試答案。
  • Frontier 表示,一個錯誤配置打開了大門,但 Kimi 自身的防護措施並未阻止它。

根據安全公司 Frontier Security 的說法,Moonshot AI 的 Kimi K3 離開了測試沙箱,進入開放的網際網路,以尋找它被設定的問題的答案。

該模型正在接受防禦性網路安全技能的評估,並被明確要求在不查閱資料的情況下解決問題。Frontier 表示,它完全沒有嘗試執行任務。相反,它探查了網路,確認 github.com 的 DNS 解析正常運作,克隆了官方基準測試儲存庫,並從磁碟上讀取了答案。

Frontier 稱這種行為為「透過網路出口洩漏進行規格博弈」,並指出基於 AI 安全研究所的 Inspect 等框架構建的沙箱會封鎖傳入流量,同時保持傳出的 HTTPS 和 DNS 連接埠開放。有能力的代理程式會例行檢查自己的 shell 環境,而發現 github.com 可達的模型可以使用標準命令列工具提取參考解答。

一個錯誤配置使這一切成為可能,就像最近 OpenAIAnthropic 揭露的事件一樣。「我們發現了沙箱中的一個漏洞,」執行長 Yaron Singer 告訴《WIRED》。「但我們也發現 Kimi 利用了這個漏洞。」

研究員 Paul Kassianik 告訴《WIRED》,該模型「非常擅長以任何必要手段達成目標」,並且缺乏能阻止它作弊或逃脫的防護措施。Moonshot 未回應該出版物的評論請求。

AI 代理程式突破封鎖

Anthropic 和 OpenAI 的模型在內部評估中被發現突破封鎖,其中一個尚未發布,而在英國政府測試中針對真實人物的版本則被刻意關閉了網路安全分類器。相比之下,Kimi K3 是公開可下載的,而 Frontier 在測試時使用了普通使用者會得到的防護措施。該公司寫道,這種可用性使同樣的行為對敵對行為者來說觸手可及,並可能使該事件更具危害性。