Em resumo

  • A equipe da Multiverse Computing publicou um método chamado Quantization-Aware Healing no blog do Hugging Face em 25 de agosto.
  • Eles reduziram o modelo aberto GPT-OSS da OpenAI de 120 bilhões de parâmetros para 60 bilhões e comprimiram sua memória para 4 bits — e a versão pequena superou o modelo de qualidade total do qual foi copiada em 7 de 9 testes.
  • O truque: ensinar o modelo reduzido a partir da versão inteligente original, não da cópia fraca intermediária.

>>>> alerta gd2md-html: link de imagem inline no código-fonte gerado e armazene as imagens no seu servidor. OBSERVAÇÃO: As imagens no arquivo zip exportado do Google Docs podem não aparecer na mesma ordem que aparecem no seu documento. Verifique as imagens!

----->

Uma equipe de pesquisadores acabou de construir uma versão menor e mais barata de um grande modelo de IA. A menor acabou sendo mais inteligente do que a versão da qual foi reduzida.

Isso não deveria acontecer.

É como perder músculo e ficar mais forte ao mesmo tempo. Mas um grupo da Multiverse Computing diz que isso aconteceu, e a razão diz algo sobre como temos reduzido a IA de forma errada.

Myriad: Quando a OpenAI lançará o GPT-6? Clique para fazer sua previsão.
Myriad: Quando a OpenAI lançará o GPT-6? Clique para fazer sua previsão.

“Para os profissionais, a mensagem prática é que em um pipeline de cura baseado em destilação, a etapa de quantização não é um custo a ser minimizado, mas uma oportunidade adicional para supervisão do professor, produzindo um modelo que é simultaneamente mais barato de servir, mais leve em memória e pelo menos tão preciso quanto sua contraparte de precisão total”, escreveram os pesquisadores em um artigo publicado na sexta-feira.

Pense nos parâmetros de um modelo de IA como uma parede gigante de botões—números que guardam tudo o que ele aprendeu. Mais botões, modelo mais inteligente, porém mais pesado de executar. O GPT-OSS 120B da OpenAI tem 120 bilhões desses botões. Cada um deles custa memória e eletricidade.

Para enviar IA de forma barata, as empresas removem botões e encolhem os sobreviventes. É como compactar uma foto: arquivo menor, mas compressão demais e a imagem fica borrada (como ir de 4K para 720p). Encolher um modelo demais e ele fica burro. Todos aceitaram essa troca.

Esses pesquisadores foram além. Eles cortaram o GPT-OSS para 60 bilhões de parâmetros e espremeram cada um em um pequeno slot de 4 bits—o equivalente digital de compressão extrema. Normalmente isso destruiria o modelo, mas esses pesquisadores encontraram uma maneira de realmente aprimorá-lo.

Em quase todos os benchmarks usados para comparação, o modelo menor superou um modelo construído com precisão total.

O erro da fotocópia

Quando você reduz um modelo, normalmente corrige seus erros comparando-o com a versão "meio reduzida" — aquela com 60 bilhões de parâmetros e maior precisão. O problema é que o modelo intermediário já é uma cópia borrada do original. Então você está ensinando o modelo pequeno a imitar um gêmeo imperfeito. Ele nunca poderá superar o gêmeo.

O que esses pesquisadores chamam de "Cura Consciente da Quantização" muda o alvo. Ele aponta o modelo pequeno de volta para o original grande e não comprimido e diz: copie as respostas deste. O modelo pequeno aprende com o mestre, não com o intermediário turvo. Em 7 de 9 testes, o modelo de 60 bilhões com 4 bits superou o gêmeo de 60 bilhões que deveria ser sua melhor metade. O verdadeiro modelo de 120 bilhões de parâmetros ainda vence a maioria das rodadas — o tamanho não foi abolido — mas a versão "dieta" ultrapassou uma barreira que ninguém pensava que pudesse.

Menor e mais inteligente é um grande negócio porque a IA consome hardware. O modelo curado precisa de aproximadamente um quarto da memória e metade dos parâmetros do original. Essa é a diferença entre uma IA que vive em um data center e uma que cabe em um desktop decente—ou, eventualmente, no seu telefone.

Portanto, um modelo que pode produzir melhores resultados enquanto consome metade da energia significa muito para pequenos laboratórios e desenvolvedores locais.

Também é gratuito. A equipe lançou o modelo curado Hypernova-60B com pesos abertos no Hugging Face, então qualquer pessoa pode baixá-lo e executá-lo. Isso se encaixa em uma sequência de modelos abertos superando barreiras surpreendentes: um modelo gratuito misterioso, Ox Alpha, recentemente derrotou um sistema Claude sem nenhum criador conhecido por trás, o hype em torno do Alibaba Qwen 3.8 Flash Next, e a onda de ajustes finos que melhoram modelos pequenos usando traços de raciocínio de LLMs maiores como Fable ou Claude Opus.

Não exagere, no entanto. A ferramenta de redução que cria o estudante de 60B é proprietária, então a receita não está totalmente aberta ainda, e a equipe testou apenas GPT-OSS—não as famílias Llama, Qwen ou Mistral.