Кратко
- Команда Multiverse Computing опубликовала метод под названием Quantization-Aware Healing в блоге Hugging Face 25 августа.
- Они уменьшили открытую модель GPT-OSS от OpenAI со 120 миллиардов параметров до 60 миллиардов и сжали её память до 4-бит — и маленькая версия превзошла полноразмерную модель, с которой она была скопирована, в 7 из 9 тестов.
- Секрет: обучать уменьшенную модель на основе оригинальной умной версии, а не на слабой промежуточной копии.
>>>> gd2md-html alert: inline image link in generated source and store images to your server. NOTE: Images in exported zip file from Google Docs may not appear in the same order as they do in your doc. Please check the images!
----->
Группа исследователей только что создала меньшую и более дешёвую версию большой модели ИИ. Меньшая оказалась умнее версии, из которой она была уменьшена.
Это как потерять мышечную массу и одновременно стать сильнее. Но группа в Multiverse Computing утверждает, что так и произошло, и причина говорит о том, как мы всё это время неправильно уменьшали ИИ.

«Для практиков практический вывод заключается в том, что в конвейере восстановления на основе дистилляции этап квантования — это не затраты, которые нужно минимизировать, а дополнительная возможность для контроля со стороны учителя, позволяющая получить модель, которая одновременно дешевле в обслуживании, легче по памяти и по крайней мере не менее точна, чем ее полноточный аналог», — написали исследователи в статье, опубликованной в пятницу.
Представьте параметры модели ИИ как гигантскую стену ручек — чисел, которые хранят все, что она выучила. Больше ручек — умнее модель, но тяжелее в работе. У OpenAI GPT-OSS 120B таких ручек 120 миллиардов. Каждая из них стоит памяти и электроэнергии.
Чтобы дешево поставлять ИИ, компании убирают ручки и уменьшают оставшиеся. Это как сжатие фото: файл меньше, но при слишком сильном сжатии изображение размывается (как переход с 4K на 720p). Сожмите модель слишком сильно — и она поглупеет. Все приняли этот компромисс.
Эти исследователи пошли дальше. Они сократили GPT-OSS до 60 миллиардов параметров и сжали каждый в крошечный 4-битный слот — цифровой эквивалент экстремального сжатия. Обычно это разрушило бы модель, но эти исследователи нашли способ фактически улучшить ее.
Почти во всех тестах, используемых для сравнения, меньшая модель превзошла модель, построенную с полной точностью.

Ошибка ксерокопии
Когда вы уменьшаете модель, вы обычно исправляете её ошибки, сравнивая её с «наполовину уменьшенной» версией — той, у которой 60 миллиардов параметров и более высокая точность. Проблема в том, что промежуточная модель уже является размытой копией оригинала. Поэтому вы учите маленькую модель подражать несовершенному близнецу. Она никогда не сможет превзойти близнеца.
То, что эти исследователи называют «исцелением с учётом квантования», меняет цель. Оно направляет маленькую модель обратно к большой, несжатой оригинальной и говорит: копируй ответы этой. Маленькая модель учится у мастера, а не у мутной середины. В 7 из 9 тестов 4-битная модель с 60 миллиардами параметров превзошла близнеца с 60 миллиардами, который должен был быть её лучшей половиной. Настоящая модель со 120 миллиардами параметров по-прежнему выигрывает большинство раундов — размер не отменён, — но «облегчённая» версия преодолела планку, которую никто не считал возможной.

Меньше и умнее — это большое дело, потому что ИИ пожирает аппаратное обеспечение. Исцелённая модель требует примерно четверть памяти и половину параметров оригинала. Это разница между ИИ, который живёт в дата-центре, и тем, который помещается на приличный настольный компьютер — или, в конечном счёте, на ваш телефон.
Таким образом, модель, которая может давать лучшие результаты, потребляя вдвое меньше энергии, много значит для небольших лабораторий и локальных разработчиков.
Это также бесплатно. Команда выпустила исцелённую модель Hypernova-60B с открытыми весами на Hugging Face, так что любой может скачать и запустить её. Это продолжает серию открытых моделей, преодолевающих удивительные барьеры: загадочная бесплатная модель Ox Alpha недавно победила систему Claude без известного создателя, ажиотаж вокруг Alibaba Qwen 3.8 Flash Next и волна дообучений, улучшающих небольшие модели с помощью следов рассуждений от более крупных LLM, таких как Fable или Claude Opus.
Однако не переусердствуйте. Инструмент сжатия, создающий студента 60B, является проприетарным, так что рецепт ещё не полностью открыт, и команда тестировала только GPT-OSS — не семейства Llama, Qwen или Mistral.






