Коротко
- Команда Multiverse Computing опублікувала метод під назвою Quantization-Aware Healing у блозі Hugging Face 25 серпня.
- Вони зменшили відкриту модель GPT-OSS від OpenAI зі 120 мільярдів параметрів до 60 мільярдів і стиснули її пам'ять до 4-біт — і мала версія перевершила повноякісну модель, з якої її скопіювали, у 7 з 9 тестів.
- Секрет: навчати зменшену модель від оригінальної розумної версії, а не від слабкої проміжної копії.
>>>> gd2md-html alert: inline image link in generated source and store images to your server. NOTE: Images in exported zip file from Google Docs may not appear in the same order as they do in your doc. Please check the images!
----->
Команда дослідників щойно створила меншу, дешевшу версію великої моделі ШІ. Менша виявилася розумнішою за версію, з якої її зменшили.
Цього не повинно було статися.
Це як втратити м'язи і водночас стати сильнішим. Але група в Multiverse Computing каже, що це сталося, і причина вказує на те, що ми весь час неправильно зменшували ШІ.

«Для практиків практичний висновок полягає в тому, що в конвеєрі зцілення на основі дистиляції квантування є не витратою, яку потрібно мінімізувати, а додатковою можливістю для контролю з боку вчителя, що дає модель, яка одночасно дешевша в обслуговуванні, легша в пам'яті та принаймні така ж точна, як і її повноточний аналог», — написали дослідники в статті, опублікованій у п'ятницю.
Уявіть параметри моделі ШІ як величезну стіну ручок — числа, які зберігають усе, що вона вивчила. Більше ручок — розумніша модель, але важча в роботі. GPT-OSS 120B від OpenAI має 120 мільярдів таких ручок. Кожна з них коштує пам'яті та електроенергії.
Щоб дешево постачати ШІ, компанії видаляють ручки та зменшують ті, що залишилися. Це як стиснення фото: менший файл, але занадто сильне стиснення робить зображення розмитим (як перехід з 4K на 720p). Занадто сильне зменшення моделі робить її тупою. Усі прийняли цей компроміс.
Ці дослідники пішли далі. Вони скоротили GPT-OSS до 60 мільярдів параметрів і стиснули кожен у крихітний 4-бітний слот — цифровий еквівалент екстремального стиснення. Зазвичай це знищило б модель, але ці дослідники знайшли спосіб фактично покращити її.
Майже в усіх контрольних показниках, використаних для порівняння, менша модель перевершила модель, побудовану з повною точністю.

Помилка фотокопії
Коли ви зменшуєте модель, ви зазвичай виправляєте її помилки, порівнюючи її з «наполовину зменшеною» версією — тією, що має 60 мільярдів параметрів і вищу точність. Проблема в тому, що проміжна модель вже є розмитою копією оригіналу. Тож ви навчаєте маленьку модель імітувати дефектного двійника. Вона ніколи не зможе перевершити двійника.
Те, що ці дослідники називають «Зціленням з урахуванням квантування», змінює ціль. Воно спрямовує маленьку модель назад до великого, нестисненого оригіналу і каже: копіюй відповіді цього. Маленька модель вчиться у майстра, а не в каламутної середини. У 7 з 9 тестів 4-бітна модель з 60 мільярдами параметрів перевершила двійника з 60 мільярдами, який мав бути її кращою половиною. Справжня модель зі 120 мільярдами параметрів все ще виграє більшість раундів — розмір не скасовано — але «дієтична» версія подолала планку, яку ніхто не вважав можливою.

Менший і розумніший — це велика справа, тому що ШІ поглинає апаратне забезпечення. Вилікувана модель потребує приблизно чверті пам'яті та половини параметрів оригіналу. Це різниця між ШІ, який живе в дата-центрі, і тим, який поміщається на пристойному робочому столі — або, зрештою, у вашому телефоні.
Отже, модель, яка може давати кращі результати, споживаючи вдвічі менше енергії, багато значить для малих лабораторій і локальних розробників.
Це також безкоштовно. Команда випустила вилікувану модель Hypernova-60B з відкритими вагами на Hugging Face, тож кожен може завантажити та запустити її. Це вписується в серію відкритих моделей, які долають дивовижні бар'єри: таємнича безкоштовна модель Ox Alpha нещодавно перевершила систему Claude без відомого творця, ажіотаж навколо Alibaba's Qwen 3.8 Flash Next, і хвиля доопрацювань, які покращують малі моделі, використовуючи сліди міркувань від більших LLM, таких як Fable або Claude Opus.
Однак не перестарайтеся. Інструмент стиснення, який створює студента 60B, є пропрієтарним, тому рецепт ще не повністю відкритий, і команда тестувала лише GPT-OSS, а не сімейства Llama, Qwen або Mistral.






