简介

  • Multiverse Computing 团队于8月25日在 Hugging Face 博客上发表了一种名为“量化感知修复”的方法。
  • 他们将 OpenAI 的开源 GPT-OSS 模型从1200亿参数缩减至600亿,并将其内存压缩至4位——而这个小版本在9项测试中的7项上击败了它所复制的全质量模型。
  • 诀窍在于:从原始智能版本而非弱化的中间副本中教学缩减后的模型。

>>>> gd2md-html 警告:生成的源中包含内联图片链接,请将图片存储到您的服务器。注意:从 Google Docs 导出的 zip 文件中的图片可能不会按照文档中的顺序出现。请检查图片!

----->

一组研究人员刚刚构建了一个大型 AI 模型的更小、更便宜的版本。结果这个小版本竟然比它被缩减前的版本更聪明。

本不该发生

这就像同时失去肌肉却变得更强壮。但 Multiverse Computing 的一个团队表示他们做到了,而原因说明了我们在缩减 AI 方面一直以来的做法是错误的。

Myriad: When will OpenAI release GPT-6? Click to make your prediction.
Myriad:OpenAI何时发布GPT-6?点击做出你的预测

“对于从业者而言,实际的信息是,在基于蒸馏的修复流程中,量化步骤不是需要最小化的成本,而是教师监督的额外机会,从而产生一个在服务上更便宜、内存占用更轻、且至少与全精度版本一样准确的模型,”研究人员在周五发表的论文中写道。

把AI模型的参数想象成一堵巨大的旋钮墙——这些数字保存了它学到的一切。旋钮越多,模型越聪明,但运行起来也更重。OpenAI的GPT-OSS 120B有1200亿个这样的旋钮。每一个都消耗内存和电力。

为了廉价地部署AI,公司会削减旋钮并缩小幸存者。这就像压缩照片:文件更小,但压缩过度图像就会模糊(就像从4K降到720p)。过度缩小模型会使其变笨。每个人都接受了这种权衡。

这些研究人员更进一步。他们将GPT-OSS削减到600亿参数,并将每个参数压缩到4位的小槽中——这相当于数字领域的极限压缩。通常这会摧毁模型,但这些研究人员找到了一种实际上能增强它的方法。

在几乎所有用于比较的基准测试中,这个较小的模型都优于以全精度构建的模型。

复印错误

当你缩小一个模型时,通常通过将其与“半缩小”版本——即拥有600亿个参数和更高精度的那个——进行比较来修复错误。问题在于,这个中间模型已经是原始模型的一个模糊副本。所以你在教小模型去模仿一个有缺陷的双胞胎。它永远无法超越这个双胞胎。

这些研究人员所称的“量化感知修复”改变了目标。它将小模型指向大的、未压缩的原始模型,并说:复制这个模型的答案。小模型从大师那里学习,而不是从模糊的中间版本。在9项测试中的7项中,4位600亿参数的模型击败了本应是其更好版本的600亿参数双胞胎。真正的1200亿参数模型仍然在大多数回合中获胜——规模并未被废除——但“节食”版本跨越了一个没人认为它能跨越的门槛。

更小更智能意义重大,因为AI消耗硬件。修复后的模型所需内存约为原来的四分之一,参数数量约为原来的一半。这决定了AI是只能存在于数据中心,还是能装进一台像样的台式机——甚至最终装进你的手机。

因此,一个能以一半能耗产生更好结果的模型,对小型实验室和本地开发者来说意义重大。

而且它还是免费的。该团队将修复后的Hypernova-60B模型以开放权重形式发布在Hugging Face上,任何人都可以下载并运行。这延续了开放模型不断突破惊人门槛的趋势:一个神秘的免费模型Ox Alpha最近在没有已知构建者的情况下击败了Claude系统,还有阿里巴巴Qwen 3.8 Flash Next引发的热潮,以及利用Fable或Claude Opus等大型LLM的推理轨迹来改进小型模型的微调浪潮。

不过,不要过度解读。用于生成60B学生模型的压缩工具是专有的,因此配方尚未完全公开,而且该团队只测试了GPT-OSS——没有测试Llama、Qwen或Mistral系列。