简介
- 阿里巴巴的Qwen团队将于周三发布Qwen 3.8-Flash-Next,这是一个混合专家模型,被描述为Qwen4架构的预览版。
- 团队在发布前的简报中称,该模型总参数为1250亿,但每个token仅激活60亿参数。
- 目前尚未公布硬性基准测试分数,且截至本文撰写时,权重尚未在ModelScope上发布。
阿里巴巴将于周三发布Qwen 3.8-Flash-Next,这是一个拥有1250亿参数的模型,每个token仅激活60亿参数。Qwen团队将其定位为下一代Qwen 4架构的预览版,而非最终旗舰模型。
目前没有关于该模型的官方信息,但根据传闻,它很可能是一个混合专家系统,这种设计将网络拆分为许多专门的子模型,并且每个任务只激活相关的子模型。因此,一个1250亿参数的模型可以以仅60亿参数的计算成本运行。
Myriad:Claude 八月份会宕机多少天?点击做出你的预测。参数基本上就是模型可以调整的所有旋钮。参数越多,模型的能力越强,所需的计算能力也越高。专家混合技术使得一个极其强大的模型能够只激活它需要的部分来提供最佳输出,而不会浪费资源。
阿里巴巴的 Qwen 团队确实将该模型描述为多模态的,并基于即将推出的 Qwen 4 架构构建,并表示他们发布了早期版本,以便开发者能够为完整的系列做好准备。
为什么“3.8”不是新闻
阿里巴巴发布了一个预告,不过团队称之为预览。计划是先推出架构改进,然后再全面推出 Qwen 4。Hugging Face 上也存放着权重,描述其为“Qwen 4 架构的预览”。
硬性基准测试尚未公布。Qwen 尚未发布与其自身 Qwen 3 系列或西方竞争对手的对比分数,因此 1250 亿和 60 亿参数的数字尚未得到验证,我们只能推测其性能。
中国的开放权重发布节奏一直不停歇。一个神秘的免费模型 Ox Alpha 最近在某些编程基准测试中击败了 Anthropic 的 Fable,但背后没有已知的构建者。阿里巴巴、DeepSeek 和 Moonshot 都发布了任何人都可以下载、微调和运行的强大权重。
开放权重让开发者无需将数据发送到封闭的 API 即可进行构建,并且降低了托管模型的成本。这就是为什么一个拥有 60 亿活跃参数的开放 1250 亿参数模型很重要:它将接近前沿的能力带到了普通硬件上。
但我们必须等待数据。截至本文撰写时,Qwen 尚未发布该版本的基准测试分数。