En bref
- L'équipe de Multiverse Computing a publié une méthode appelée Quantization-Aware Healing sur le blog Hugging Face le 25 août.
- Ils ont réduit le modèle open GPT-OSS d'OpenAI de 120 milliards de paramètres à 60 milliards et compressé sa mémoire à 4 bits—et la petite version a battu le modèle de pleine qualité dont elle était copiée sur 7 des 9 tests.
- L'astuce : enseigner au modèle réduit à partir de la version intelligente originale, et non de la copie intermédiaire faible.
>>>> alerte gd2md-html : lien d'image en ligne dans la source générée et stockez les images sur votre serveur. REMARQUE : les images du fichier zip exporté de Google Docs peuvent ne pas apparaître dans le même ordre que dans votre document. Veuillez vérifier les images !
----->
Une équipe de chercheurs vient de construire une version plus petite et moins chère d'un grand modèle d'IA. La version plus petite s'est avérée plus intelligente que la version dont elle était issue.
Cela ne devrait pas arriver.
C'est comme perdre du muscle et devenir plus fort en même temps. Mais un groupe de Multiverse Computing affirme que c'est le cas, et la raison en dit long sur la façon dont nous avons mal réduit l'IA.

« Pour les praticiens, le message pratique est que dans un pipeline de guérison basé sur la distillation, l'étape de quantification n'est pas un coût à minimiser mais une opportunité supplémentaire de supervision par l'enseignant, produisant un modèle qui est à la fois moins cher à servir, plus léger en mémoire, et au moins aussi précis que son homologue en pleine précision », ont écrit les chercheurs dans un article publié vendredi.
Pensez aux paramètres d'un modèle d'IA comme à un immense mur de boutons—des nombres qui contiennent tout ce qu'il a appris. Plus de boutons, modèle plus intelligent, mais plus lourd à exécuter. Le GPT-OSS 120B d'OpenAI possède 120 milliards de ces boutons. Chacun d'eux coûte de la mémoire et de l'électricité.
Pour commercialiser l'IA à moindre coût, les entreprises suppriment des boutons et réduisent les survivants. C'est comme compresser une photo : fichier plus petit, mais trop de compression et l'image devient floue (comme passer de la 4K à la 720p). Réduire trop un modèle et il devient stupide. Tout le monde a accepté ce compromis.
Ces chercheurs sont allés plus loin. Ils ont réduit GPT-OSS à 60 milliards de paramètres et ont compressé chacun dans un minuscule emplacement de 4 bits—l'équivalent numérique d'une compression extrême. Normalement, cela détruirait le modèle, mais ces chercheurs ont trouvé un moyen de l'améliorer réellement.
Dans presque tous les benchmarks utilisés pour la comparaison, le modèle plus petit a surpassé un modèle construit avec une pleine précision.

L'erreur de photocopie
Lorsque vous réduisez un modèle, vous corrigez généralement ses erreurs en le comparant à la version « à moitié réduite » – celle avec 60 milliards de paramètres et une précision plus élevée. Le problème est que le modèle intermédiaire est déjà une copie floue de l'original. Vous apprenez donc au petit modèle à imiter un jumeau imparfait. Il ne pourra jamais dépasser ce jumeau.
Ce que ces chercheurs appellent « Quantization-Aware Healing » change la cible. Il oriente le petit modèle vers l'original volumineux et non compressé et lui dit : copie les réponses de celui-ci. Le petit modèle apprend du maître, non du milieu boueux. Sur 7 des 9 tests, le modèle de 60 milliards en 4 bits a battu le jumeau de 60 milliards qui était censé être sa meilleure moitié. Le véritable modèle à 120 milliards de paramètres gagne toujours la plupart des tours – la taille n'a pas été abolie – mais la version « allégée » a franchi une barre que personne ne pensait possible.

Plus petit et plus intelligent est un gros problème car l'IA dévore le matériel. Le modèle guéri nécessite environ un quart de la mémoire et la moitié des paramètres de l'original. C'est l'écart entre une IA qui vit dans un centre de données et une qui tient sur un bon ordinateur de bureau—ou, éventuellement, sur votre téléphone.
Ainsi, un modèle capable de produire de meilleurs résultats tout en consommant moitié moins d'énergie signifie beaucoup pour les petits laboratoires et les développeurs locaux.
C'est aussi gratuit. L'équipe a publié le modèle guéri Hypernova-60B en poids ouverts sur Hugging Face, donc n'importe qui peut le télécharger et l'exécuter. Cela s'inscrit dans une série de modèles ouverts qui franchissent des barres surprenantes : un mystérieux modèle gratuit, Ox Alpha, a récemment battu un système Claude sans constructeur connu derrière lui, le battage médiatique autour du Qwen 3.8 Flash Next d'Alibaba, et la vague de finetunes qui améliorent les petits modèles en utilisant des traces de raisonnement provenant de grands LLM comme Fable ou Claude Opus.
Ne vous emballez pas trop, cependant. L'outil de réduction qui produit l'étudiant 60B est propriétaire, donc la recette n'est pas encore entièrement ouverte, et l'équipe n'a testé que GPT-OSS—pas les familles Llama, Qwen ou Mistral.






