剛剛,Claude Fable 5 又奪冠了

MirrorCodeClaude專案級委託AI程式設計程式碼生成GPT
2026-08-05來源: blockweeks.com
剛剛,Claude Fable 5 又奪冠了

Claude這次,真把AI編程榜單打出斷層了!

就在剛剛刷新的MirrorCode排行榜上,Claude Fable 5以64%的絕對成功率再次登頂。

緊追其後的GPT-5.6 Sol,分數只有它的三分之一!

排在第四的GPT-5.5更慘。不僅成績只有10%,甚至還被自家前輩GPT-5.4按在地上摩擦。

AI編程

更讓人意外的是,在使用Go等高資源語言時,Fable 5的解出率是64%;換成冷門語言Ada,成績仍然高達61%。

要知道,在開源世界裡,Python語料大約是Ada的230倍。

但到了Fable 5這裡,成績居然只下降3個百分點。

AI編程

這就有意思了。

如果模型主要靠記憶熱門語言的語法和常見寫法,那麼換成Ada之後成績應該出現下降才對。

而現在的結果,卻指向另一種可能——

最強模型已經擺脫了具體語料的牽引,開始學會如何從零構建一個完整的軟體專案。

卡死在100%通關線,100億Token極限測試

具體來說,完整的MirrorCode包含25個目標程式,覆蓋Unix工具、直譯器、資料查詢、生物資訊學、密碼學和壓縮工具等領域。

在這裡,模型會被放進隔離環境,沒有網際網路,看不到原專案原始碼,也不能下載第三方依賴。它能拿到的只有高層文件、一部分可見測試,以及一個可以反覆呼叫的原程式。

接下來,它要不斷向原程式輸入資料,觀察輸出猜內部邏輯,再一

點點
寫出一個行為一致的新程式。

最新榜單從中選出15個Medium和Large目標。每個目標使用兩種實現語言,每種語言執行三次。

並且,可見測試與隱藏測試的完成率必須達到100%才算通過,99.9%都不行。

只要漏掉一個邊緣案例,整次執行仍然按失敗計算。

AI編程

為了逼模型把最後幾個缺口也補上,MirrorCode把單次預算推到100億Token,最長允許連續執行7天。

論文中成本最高的一次任務更誇張:模型連續跑了19天,單次花費達到2600美元。

在這19天裡,模型會反覆執行原程式、比較結果、補寫功能,再把測試重新跑一遍。報錯了就查原因,輸出對不上就換假設,局部通過了再去追下一個缺口。

整個過程,更像一場持續數天的除錯,而不是一次生成。

AI編程

gotree的例子最直觀。

這個生物資訊學工具原本有大約1.6萬行Go程式碼和40多個命令。

Claude Opus 4.7花了14小時和251美元,通過了2001項測試中的2000項,完成度達到了99.95%。

雖然漏掉了一個處理日期註解的冷門邊界,被MirrorCode的100%通關線攔了下來,但它已經把原本按週計算的工程量,壓進了十幾個小時——

Epoch估計,如果不使用AI,人類工程師想要完成同一任務至少需要2到17週。

語料荒漠裡,Fable 5只掉了3分

MirrorCode論文曾用StarCoder的公開訓練混合作為參照。

其中Python約佔8%,Ada只有0.034%,前者大約是後者的230倍。

AI程式設計

當然,我們無法知道閉源模型到底見過多少Ada程式碼。但拿公開生態作參照,Ada有多稀缺已經足夠直觀。

這門語言主要出現在航空航天、國防和其他安全關鍵系統中。無論社群規模、教學數量還是開源專案,都遠不能與Python、JavaScript或者Go相比。

而Fable 5顯然不是在把Go程式碼逐句翻譯成Ada。

它更像是先摸清原程式究竟怎麼運作,再換一門語言,把同樣的行為重新造出來。

AI程式設計

相比之下,其他模型就沒這麼穩了。

GPT-5.6 Sol從24%降到19%,GPT-5.4從21%降到12%,GPT-5.5更是從17%掉到5%。語言一換,差距立刻被放大。

把整個專案交給AI

如今,Cursor已經讓數百個Agent協作近一週,從零寫出超過100萬行、分佈在1000個檔案裡的瀏覽器程式碼。

Anthropic則讓16個Claude Agent並行跑了近2000次會話,最終搭出一套10萬行、能夠編譯Linux 6.9核心的C編譯器。

OpenAI揭露的截至5月Codex個人使用者樣本中,70.2%至少提交過一次預計超過一小時人類工作量的任務;25.6%提交過超過八小時的任務。

人們交給AI的單位,正在從一段程式碼、一個bug,變成一個下午、一週,甚至整個專案。

MirrorCode的64%,正是對這種「專案級委託」的一次量化。

它說明,只要目標足夠明確,結果能夠自動驗收,前沿模型已經可以獨立做完一部分中大型軟體。

對每一個正在把工作交給AI的人來說,變化已經近在眼前——

以前你需要盯著它寫每一段程式碼,接下來,你更可能只在關鍵節點檢查它有沒有跑偏。

程式碼會越來越便宜。

而那些能把問題說清楚、把結果驗明白的人,會越來越值錢。

參考資料:https://epoch.ai/MirrorCode

本文來自微信公眾號「新智元」,作者:ASI啟示錄;編輯:摩西