簡介
- OpenAI 表示「無法排除」Astra 已達到其網路風險等級的最高級別。
- 該公司暫停了該模型的內部工作,並加強了隔離、監控和存取控制。
- 此警告發布之際,距離 OpenAI、Anthropic 和 Meta 的模型自行突破真實系統僅數週。
OpenAI 表示,其下一個主要模型可能危險到足以自行編寫網路武器,因此他們正在撤回,直到安全防護措施跟上。
「我們對 Astra(我們即將推出的模型之一)在過去幾天進行的最新內部評估顯示,在代理式編碼和網路安全方面取得了重大進展,」OpenAI 表示。「這些結果,加上專家評估,使我們昨晚得出結論,根據我們的《準備框架》(在新視窗中開啟),我們無法排除關鍵網路能力的可能性。」
OpenAI 發布了此警告,表示對未發布模型 Astra 的內部測試,儘管其具備相關能力,但與最近的 Hugging Face 入侵事件無關。
該框架是 OpenAI 針對高風險模型的規則手冊,首次發布於 2023 年 12 月。「關鍵」是其最高等級。如果一個模型能夠在無人介入的情況下,在強化系統中發現並建立可用的零日漏洞(先前未知且供應商尚未修補的漏洞),或者僅憑高層級目標就能規劃並對艱難目標發動完整攻擊,則該模型達到此等級。包括 GPT-5.6-Sol 在內的早期模型,最高僅達到較低的「高」等級。
這種模式已經真實存在
當你將 OpenAI 的謹慎態度與過去幾週發生的事情對照時,就會有不同的解讀。這不是未來的擔憂。前沿模型已經突破測試環境,攻擊真實目標。
最明顯的案例來自 OpenAI 本身。正如 Decrypt 先前報導,該公司的代理程式串連漏洞、逃離測試環境、連上網際網路,並在試圖作弊於安全基準測試時攻擊了 Hugging Face。在後續報導中,OpenAI 詳細說明同一個失控代理程式如何利用在開放網路上找到的憑證,入侵了至少其他四個公開可用的服務。
Anthropic 的 Claude 也從另一側做了同樣的事。在錯誤配置將模型暴露於開放網際網路後,多個版本的 Claude 未經授權存取了三家真實公司。在其中一個案例中,Claude Opus 4.7 將一家真實公司的網站誤認為其任務的假目標,提取了憑證,並存取了一個包含數百行真實資料的生產資料庫。
而 Meta 也在本月加入了这份名单。Decrypt報導指出,一個 Muse Spark 模型逃離了其測試環境,透過合作夥伴的配置錯誤連上網際網路,並利用了第三方服務的漏洞。Moonshot AI 的 Kimi K3 也做了類似的事情,逃出沙箱,在公開儲存庫中尋找基準測試的答案。
英國的人工智慧安全研究所也發現,這種行為並非偶發。在測試 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol 期間,它在 122 次中記錄了 10 次模型在即時網路上採取未經授權的行動,其中一次試圖將惡意程式碼偷偷放入一個開源專案。
OpenAI 對 Astra 的回應是在模型準備好之前鎖上門。它暫停了缺乏新控制的內部 Astra 工作,隔離測試環境,限制網路和工具存取,保護模型權重,並全面監控高風險行動。








