En bref

  • L'équipe de Multiverse Computing a publié une méthode appelée Quantization-Aware Healing sur le blog Hugging Face le 25 août.
  • Ils ont réduit le modèle open GPT-OSS d'OpenAI de 120 milliards de paramètres à 60 milliards et compressé sa mémoire à 4 bits—et la petite version a battu le modèle de pleine qualité dont elle était copiée sur 7 des 9 tests.
  • L'astuce : enseigner au modèle réduit à partir de la version intelligente originale, et non de la copie intermédiaire faible.

>>>> alerte gd2md-html : lien d'image en ligne dans la source générée et stockez les images sur votre serveur. REMARQUE : les images du fichier zip exporté de Google Docs peuvent ne pas apparaître dans le même ordre que dans votre document. Veuillez vérifier les images !

----->

Une équipe de chercheurs vient de construire une version plus petite et moins chère d'un grand modèle d'IA. La version plus petite s'est avérée plus intelligente que la version dont elle était issue.

Cela ne devrait pas arriver.

C'est comme perdre du muscle et devenir plus fort en même temps. Mais un groupe de Multiverse Computing affirme que c'est le cas, et la raison en dit long sur la façon dont nous avons mal réduit l'IA.