簡介
- 阿里巴巴的Qwen團隊將於週三發布Qwen 3.8-Flash-Next,這是一個混合專家模型,被描述為Qwen4架構的預覽版。
- 團隊在發布前的簡報中提及,總參數為1250億,但每個token僅啟動60億參數。
- 目前尚未公布硬性基準測試分數,且截至撰寫本文時,權重尚未在ModelScope上線。
阿里巴巴將於週三發布Qwen 3.8-Flash-Next,這是一個擁有1250億參數的模型,每個token僅啟動60億參數。Qwen團隊將其定位為下一代Qwen 4架構的預覽版,而非最終旗艦模型。
目前尚無官方資訊,但根據傳聞,它很可能是一個混合專家系統,這種設計將網絡拆分為許多專門的子模型,並針對每個任務僅啟動相關的子模型。因此,一個1250億參數的模型,其運算成本僅相當於一個60億參數的模型。
Myriad:Claude 會停擺多少天?點擊進行預測。參數基本上就是模型可以調整的所有旋鈕。參數越多,模型的能力越強,所需的運算能力也越高。混合專家(Mixture of Experts)使得一個極其強大的模型能夠只啟動它需要的部分來提供最佳輸出,而不浪費資源。
阿里巴巴的 Qwen 團隊確實將該模型描述為多模態,並基於即將推出的 Qwen 4 架構,並表示他們發布了早期版本,以便開發者能為完整的系列做好準備。
為什麼「3.8」不是新聞
阿里巴巴已經發布了一個預告,不過團隊稱之為預覽。計劃是現在就推出架構改進,搶先於完整的 Qwen 4 發布。Hugging Face 上也存放著權重,描述它為「Qwen 4 架構的預覽」。
嚴格的基準測試尚未出爐。Qwen 尚未發布與自家 Qwen 3 系列或西方競爭對手的對比分數,因此 1250 億和 60 億參數的數字尚未得到驗證,我們只能推測其性能。
中國的開放權重發布節奏一直沒有停歇。一個神秘的免費模型 Ox Alpha 最近在某些程式碼基準測試上擊敗了 Anthropic 的 Fable,背後沒有已知的建構者。阿里巴巴、DeepSeek 和 Moonshot 都發布了任何人都可以下載、微調和執行的強大權重。
開放權重讓開發者無需將數據發送到封閉的 API 即可進行建構,並降低了託管模型的成本。這就是為什麼一個擁有 60 億活躍參數的開放 1250 億參數模型很重要:它將接近前沿的能力帶到了商用硬體上。
但我們必須等待數字。截至撰寫本文時,Qwen 尚未發布該版本的基準測試分數。