簡介

  • Meta 發布了 Muse Code(測試版),這是一款由更新後的編碼模型 Muse Spark 1.2 驅動的終端編碼代理。它現在可通過 Meta Model API 和 curl 安裝腳本使用。
  • 該代理協調持續運行的後台子代理,並保留精確重放的事件日誌,因此崩潰後可以從停止的地方精確恢復。
  • 在 Meta 自己的圖表中,Muse Spark 1.2 在所示的所有編碼基準測試中都落後於 Anthropic 的 Opus 5,但在大多數基準測試中擊敗了 OpenAI 的 Codex 和 Google 的 Antigravity。

Meta 是最新一家推出編碼代理的科技巨頭,正競相與領先的人工智能巨頭 Anthropic 和 OpenAI 競爭。

「我們很高興發布 Muse Code(測試版),這是一款由我們最新的模型 Muse Spark 1.2 驅動的終端編碼代理,」該公司在官方公告中寫道。「這標誌著我們向前沿邁出的下一步,更大、更強大的模型即將推出。」

作為一款代理式編碼工具,Muse Code 專為大型代碼庫中的軟件工程而構建。據 Meta 稱,它「承擔大型代碼庫中的複雜軟件工程任務:規劃更改、編寫代碼和驗證結果。它可以為每個任務協調多個持續運行的子代理,更快、更準確、更少干預地解決難題。」

最突出的細節是運行時。Muse Code 將每次模型調用、工具運行、批准和編輯記錄到本地事件日誌中,該日誌作為單一事實來源。「這個單一事實來源使運行時具有精確重放和重啟安全特性:崩潰後,代理可以精確地從停止的地方恢復,」Meta 表示。對於長時間運行的任務,這個功能比原始速度更重要——而競爭對手尚未將其作為賣點。

它還配備了默認技能。「/plan」命令將任務轉化為需要批准的計劃,而「/grill」則對該計劃進行壓力測試,直到其站穩腳跟,「/goal」則致力於成功完成目標,類似於 Hermes 的做法。Meta 表示,它與 Muse Code 共同訓練了 Muse Spark 1.2,使核心 LLM 和代理協同工作。

基準測試與隱憂

Muse Spark 1.2 是 Muse Spark 1.1 的編碼重點更新。Meta 表示,它「顯著擴大了編碼任務的訓練計算量,同時擴大了訓練環境的多樣性,在代碼生成、複雜調試和端到端開發者工作流程方面帶來了改進。」圖表清楚地說明了這一點。

在 Terminal-Bench 2.1 上,配備 Muse Code 的 Muse Spark 1.2 得分為 82.9%,落後於 Opus 5 上的Claude Code(86.7%),但領先於 Codex 上的 GPT-5.6 Terra(81.8%)和 Grok Build(81.6%)。

DeepSWE 1.1(衡量代理編碼能力)的差距較小:Muse 為 59.3%,而 Opus 5 為 65.0%,Codex 為 64.8%。在 Meta 的內部編碼基準測試中,Muse 達到 70.6%,而 Opus 5 為 79.4%。

加速圖表則翻轉了順序。在超過 1,000 次工具呼叫中,Opus 5 相對於基線的增幅最大(約 74–75%),而 Muse Spark 1.2 則居中,視運行情況約為 61–69%。Meta 的觀點是,隨著工具呼叫的累積,代理會持續改進,這正是您希望從長期編碼器中獲得的行為。

最有趣的示範是長程和多模態的。在壓力測試中,Meta 表示 Muse Code「在 Nvidia Hopper GPU 上透過 1,000 多次工具呼叫(長達 24 小時)迭代優化 GPU 核心」。這意味著它能夠隨著時間改進。

還有一個視覺編碼的角度。在一個示範中,使用者將房屋的飛越影片以 mp4 格式放入終端機,Muse Code「解讀影片並產生一個具有預訂功能的視覺豐富網站」。將原始影片讀入可運作的網頁應用程式,正是 Meta 在整個 Muse 系列中所提出的多模態主張。

請參閱發布貼文:

這個領域已經很擁擠

話雖如此,Meta 在這場競爭中已經落後。OpenAI 的 Codex 已經可以運行 並行雲端代理;DeepSeek 已經建立了自己的 Claude Code 競爭對手,而像 Hermes 或 OpenClaw 這樣的代理工具已經是具備更多功能的良好替代品。Muse Code 的優勢在於崩潰安全的運行時和子代理設計,而不是基準測試的領先地位。

對於代理式編碼來說,風險是常見的那種:一個在崩潰後恢復並持續呼叫工具長達24小時的代理既強大又難以預測。Meta 賭的是開發者想要這種自主性,而它現在就推出了。

Muse Code 可於安裝後輸入以下指令進行測試:
curl -fsSL https://dev.meta.ai/install.sh | bash