簡介
- Multiverse Computing 的團隊於8月25日在 Hugging Face 部落格上發表了一種名為「量化感知修復」的方法。
- 他們將 OpenAI 的開源 GPT-OSS 模型從1200億個參數縮減至600億,並將其記憶體壓縮至4位元——而這個較小的版本在9項測試中有7項擊敗了它所複製的全品質模型。
- 訣竅在於:從原始智慧版本教導縮小的模型,而不是從較弱的半成品複製品。
>>>> gd2md-html 警報: 產生的原始碼中有內嵌圖片連結,請將圖片儲存到您的伺服器。注意:從 Google Docs 匯出的 zip 檔案中的圖片可能不會按照文件中出現的順序顯示。請檢查圖片!
----->
一組研究人員剛剛打造了一個較小、較便宜的大型 AI 模型版本。結果這個較小的版本竟然比它縮減自的版本更聰明。
這種情況不應該發生。
這就像同時失去肌肉卻變得更強壯。但 Multiverse Computing 的一組人表示他們做到了,而這個原因說明了我們一直以來縮小 AI 的方式可能完全錯誤。

“對於實務工作者而言,實際的訊息是:在基於蒸餾的修復流程中,量化步驟不是需要最小化的成本,而是教師監督的額外機會,從而產生一個同時更便宜、記憶體更輕量,且至少與全精度版本一樣準確的模型。”研究人員在週五發表的論文中寫道。
把 AI 模型的參數想像成一面巨大的旋鈕牆——這些數字保存了它學到的一切。旋鈕越多,模型越聰明,但運行起來也越重。OpenAI 的 GPT-OSS 120B 有 1200 億個這樣的旋鈕。每一個都消耗記憶體和電力。
為了廉價地部署 AI,公司會剝離旋鈕並縮小倖存者。這就像壓縮照片:檔案變小,但過度壓縮會使影像模糊(就像從 4K 降到 720p)。過度縮小模型會使其變笨。每個人都接受了這種取捨。
這些研究人員更進一步。他們將 GPT-OSS 削減至 600 億個參數,並將每個參數壓縮到一個微小的 4 位元槽中——這相當於數位領域的極端壓縮。通常這會摧毀模型,但這些研究人員找到了一種實際增強它的方法。
在幾乎所有用於比較的基準測試中,這個較小的模型都優於以全精度構建的模型。

影印錯誤
當你縮小一個模型時,通常會透過與「縮小一半」的版本——也就是那個擁有600億個旋鈕且精度更高的版本——進行比較來修正錯誤。問題在於,這個中途模型已經是原始模型的模糊副本。所以你是在教這個小模型去模仿一個有缺陷的雙胞胎。它永遠無法超越這個雙胞胎。
這些研究人員所稱的「量化感知修復」改變了目標。它將小模型指向那個龐大、未壓縮的原始模型,並說:複製這個模型的答案。小模型向大師學習,而不是向渾濁的中間版本學習。在9項測試中的7項中,4位元的600億參數模型擊敗了本應是其更好版本的600億雙胞胎模型。真正的1200億參數模型仍然贏得大多數回合——規模尚未被廢除——但「節食」版本跨越了沒人認為它能跨越的門檻。

更小更聰明之所以重要,是因為 AI 會消耗硬體資源。修復後的模型大約只需要原始模型四分之一的記憶體和一半的參數。這就是資料中心裡的 AI 與能裝進一台像樣桌上型電腦——或最終裝進你手機裡的 AI 之間的差距。
因此,一個能以一半能耗產生更好結果的模型,對小型實驗室和本地開發者來說意義重大。
而且它還是免費的。團隊已將修復後的 Hypernova-60B 模型以開放權重的形式發布在 Hugging Face 上,任何人都可以下載並運行。這延續了開放模型屢屢突破驚人門檻的趨勢:一個神秘的免費模型 Ox Alpha 最近擊敗了 Claude 系統,背後沒有已知的建構者;阿里巴巴的 Qwen 3.8 Flash Next 引發熱潮;以及一波利用 Fable 或 Claude Opus 等大型 LLM 的推理軌跡來改進小型模型的微調浪潮。
不過,別過度解讀。用來製造 60B 學生的縮小工具是專有的,所以配方尚未完全公開,而且團隊只測試了 GPT-OSS——沒有測試 Llama、Qwen 或 Mistral 系列。






