W skrócie
- Zespół Multiverse Computing opublikował metodę zwaną Quantization-Aware Healing na blogu Hugging Face 25 sierpnia.
- Zmniejszyli model OpenAI GPT-OSS ze 120 miliardów parametrów do 60 miliardów i skompresowali jego pamięć do 4 bitów – a mała wersja pokonała pełnowymiarowy model, z którego została skopiowana, w 7 z 9 testów.
- Sztuczka: naucz zmniejszony model od oryginalnej inteligentnej wersji, a nie od słabej pośredniej kopii.
>>>> alert gd2md-html: link do obrazu inline w wygenerowanym źródle i przechowuj obrazy na swoim serwerze. UWAGA: Obrazy w wyeksportowanym pliku zip z Dokumentów Google mogą nie pojawiać się w tej samej kolejności, co w dokumencie. Sprawdź obrazy!
----->
Zespół badaczy właśnie zbudował mniejszą, tańszą wersję dużego modelu AI. Mniejszy okazał się mądrzejszy niż wersja, z której został zmniejszony.
To jak utrata mięśni i jednoczesne wzmocnienie. Ale grupa w Multiverse Computing twierdzi, że tak się stało, a powód mówi coś o tym, jak błędnie zmniejszaliśmy AI.

„Dla praktyków praktyczny wniosek jest taki, że w rurociągu uzdrawiania opartym na destylacji etap kwantyzacji nie jest kosztem, który należy minimalizować, ale dodatkową okazją do nadzoru nauczyciela, dając model, który jest jednocześnie tańszy w obsłudze, lżejszy w pamięci i co najmniej tak dokładny, jak jego odpowiednik w pełnej precyzji” – napisali naukowcy w artykule opublikowanym w piątek.
Pomyśl o parametrach modelu AI jako o ogromnej ścianie pokręteł – liczbach, które przechowują wszystko, czego się nauczył. Więcej pokręteł, mądrzejszy model, ale cięższy w działaniu. GPT-OSS 120B od OpenAI ma 120 miliardów tych pokręteł. Każde z nich kosztuje pamięć i energię elektryczną.
Aby tanio dostarczać AI, firmy usuwają pokrętła i zmniejszają te, które pozostają. To jak kompresowanie zdjęcia: mniejszy plik, ale zbyt duża kompresja powoduje rozmycie obrazu (jak przejście z 4K do 720p). Zbyt mocne zmniejszenie modelu powoduje, że staje się głupi. Wszyscy zaakceptowali ten kompromis.
Ci naukowcy poszli dalej. Zmniejszyli GPT-OSS do 60 miliardów parametrów i ścisnęli każdy z nich do małego 4-bitowego slotu – cyfrowy odpowiednik ekstremalnej kompresji. Normalnie zniszczyłoby to model, ale ci naukowcy znaleźli sposób, aby go faktycznie ulepszyć.
W prawie wszystkich benchmarkach używanych do porównania, mniejszy model przewyższał model zbudowany z pełną precyzją.

Błąd kserokopii
Kiedy zmniejszasz model, zwykle naprawiasz jego błędy, porównując go z wersją „w połowie zmniejszoną” – tą z 60 miliardami pokręteł i wyższą precyzją. Problem polega na tym, że model w połowie drogi jest już rozmytą kopią oryginału. Więc uczysz mały model naśladowania wadliwego bliźniaka. Nigdy nie może wyrosnąć ponad bliźniaka.
To, co ci naukowcy nazywają „Uzdrawianiem uwzględniającym kwantyzację”, zmienia cel. Wskazuje małemu modelowi na duży, nieskompresowany oryginał i mówi: kopiuj odpowiedzi tego. Mały model uczy się od mistrza, a nie od mętnego pośrednika. W 7 z 9 testów model 4-bitowy o 60 miliardach parametrów pokonał bliźniaka o 60 miliardach, który miał być jego lepszą połową. Prawdziwy model o 120 miliardach parametrów nadal wygrywa większość rund – rozmiar nie został zniesiony – ale wersja „dietetyczna” przekroczyła poprzeczkę, której nikt nie sądził, że może przekroczyć.

Mniejsze i mądrzejsze to wielka sprawa, ponieważ AI pochłania sprzęt. Uzdrowiony model potrzebuje mniej więcej ćwierć pamięci i połowę parametrów oryginału. To różnica między AI, która żyje w centrum danych, a taką, która mieści się na przyzwoitym komputerze stacjonarnym—albo, w końcu, na twoim telefonie.
Zatem model, który może dawać lepsze wyniki przy zużywaniu połowy energii, wiele znaczy dla małych laboratoriów i lokalnych programistów.
Jest też darmowy. Zespół udostępnił uzdrowiony model Hypernova-60B jako otwarte wagi na Hugging Face, więc każdy może go pobrać i uruchomić. To wpisuje się w passę otwartych modeli przekraczających zaskakujące poprzeczki: tajemniczy darmowy model, Ox Alpha, niedawno pokonał system Claude bez znanego twórcy, szum wokół Alibaba's Qwen 3.8 Flash Next oraz fala fine-tuningów, które ulepszają małe modele, używając śladów rozumowania z większych LLM-ów, takich jak Fable czy Claude Opus.
Nie przesadzaj jednak. Narzędzie do zmniejszania, które tworzy ucznia 60B, jest zastrzeżone, więc przepis nie jest w pełni otwarty, a zespół przetestował tylko GPT-OSS—nie rodziny Llama, Qwen ani Mistral.






