簡介

  • Qwen3.8-Max 運行 2.4 兆個參數,是阿里巴巴首個以開放權重發布的 Max 級 Qwen 模型。
  • 它附帶了 Anthropic 的 Claude Code 和 OpenAI 的 Codex(競爭對手工具)的設置說明。
  • 在阿里巴巴自己的基準測試表中,Fable 5 贏得了 31 項測試中的 15 項。Qwen3.8-Max 贏得了 7 項。

阿里巴巴於週一發布了 Qwen3.8-Max,稱其為迄今為止所打造的最強大模型。權重將於下週在 Hugging Face 和 ModelScope 上發布——這是該公司首次以 Max 規模免費提供模型。

規格相當龐大:總共 2.4 兆個參數,但任何時刻僅啟動 950 億個。參數是模型能夠處理的調節旋鈕數量。

這對效率極為重要,因為這意味著運行它不需要太多資源。可以把它想像成一個巨大的圖書館,每個問題只會點亮相關的書架。擁有足夠好硬體的小型企業和實驗室現在能夠運行最先進的模型,而無需花費與大型數據中心相同的成本。

阿里巴巴的發布文章跳過了常見的基準測試追逐敘事,轉而強調耐力。該模型花了 16 天獨自構建了一個編碼工具——265 次提交、127 個拉取請求、151 個問題,全程無人觸碰鍵盤。它花了五天時間重現一篇從未見過程式碼的研究論文,然後以 2.7 分的優勢超越了論文自身的結果。在一場 24 小時的機器學習競賽中,它在 526 個人類團隊中排名第 458 位之前。

專為在競爭對手的工具中運行而設計

Qwen3.8-Max 附帶了 Claude Code 和 Codex(Anthropic 和 OpenAI 開發的編碼工具)的說明。阿里巴巴的 API 支援這兩家公司的協議。其大部分編碼基準測試都是在 Claude Code 中進行的。

這些基準測試對它並不有利。在 31 項文本測試中,Anthropic 的 Fable 5 佔據了 15 個第一名,OpenAI 的 GPT-5.6 Sol 佔據了 9 個,Qwen 佔據了 7 個。在 12 項編碼測試中,Qwen 僅贏得一項。然而,就智能成本而言,這個模型極其便宜且高效,這意味著即使它需要更多的迭代或推理,完成工作的成本也會低得多,大約是 Claude Fable 5 收費的 30%。

話雖如此,轉向多模態工作——文件、影片、空間推理——排名就反轉了。Qwen 在該表的大部分項目中領先。

在商業策略上也有反轉。四月,阿里巴巴終止了 Qwen Code 的免費層級,團隊在領導層離職後轉向封閉、付費模式。我們對Qwen 3.7 Max 的評測指出 Plus 版本將保持開放,而 Max 則鎖在 API 之後。

那扇門現在打開了,時機並非偶然。中國的開放權重模型在 OpenRouter 上的代幣佔比從 2024 年底的不到 2% 上升到 2026 年中期的約 61%。Qwen 超越了 Meta 的 Llama,成為全球最常自行架設的模型。

與此同時,華盛頓在六月以出口管制限制了 Fable 5 和 Mythos 5,而北京據報正在考慮對中國模型出海施加自己的限制。

所以阿里巴巴在紙面上輸了,但在分發上贏了。如果你能免費下載到接近的東西,第二名也是個不錯的位置。