En resumen
- El equipo de Multiverse Computing publicó un método llamado Quantization-Aware Healing en el blog de Hugging Face el 25 de agosto.
- Redujeron el modelo abierto GPT-OSS de OpenAI de 120 mil millones de parámetros a 60 mil millones y comprimieron su memoria a 4 bits, y la versión pequeña superó al modelo de calidad completa del que se copió en 7 de 9 pruebas.
- El truco: enseñar al modelo reducido desde la versión inteligente original, no desde la copia intermedia débil.
>>>> alerta gd2md-html: enlace de imagen en línea en el código fuente generado y almacene las imágenes en su servidor. NOTA: Las imágenes en el archivo zip exportado de Google Docs pueden no aparecer en el mismo orden que en su documento. ¡Por favor, revise las imágenes!
----->
Un equipo de investigadores acaba de construir una versión más pequeña y más barata de un gran modelo de IA. El más pequeño resultó ser más inteligente que la versión de la que se redujo.
Eso no debería suceder.
Es como perder músculo y volverse más fuerte al mismo tiempo. Pero un grupo de Multiverse Computing dice que lo logró, y la razón dice algo sobre cómo hemos estado reduciendo la IA de manera incorrecta.

“Para los profesionales, el mensaje práctico es que en un pipeline de curación basado en destilación, el paso de cuantización no es un costo a minimizar sino una oportunidad adicional para la supervisión del maestro, produciendo un modelo que es simultáneamente más barato de servir, más ligero en memoria y al menos tan preciso como su contraparte de precisión completa”, escribieron los investigadores en un artículo publicado el viernes.
Piense en los parámetros de un modelo de IA como una pared gigante de perillas: números que contienen todo lo que ha aprendido. Más perillas, modelo más inteligente, pero más pesado de ejecutar. El GPT-OSS 120B de OpenAI tiene 120 mil millones de esas perillas. Cada una de ellas cuesta memoria y electricidad.
Para enviar IA de manera económica, las empresas eliminan perillas y encogen a las supervivientes. Es como comprimir una foto: archivo más pequeño, pero demasiada compresión y la imagen se vuelve borrosa (como pasar de 4K a 720p). Encoger un modelo demasiado y se vuelve tonto. Todos aceptaron ese intercambio.
Estos investigadores fueron más allá. Redujeron GPT-OSS a 60 mil millones de parámetros y exprimieron cada uno en una pequeña ranura de 4 bits: el equivalente digital de la compresión extrema. Normalmente eso destrozaría el modelo, pero estos investigadores encontraron una manera de mejorarlo realmente.
En casi todos los puntos de referencia utilizados para la comparación, el modelo más pequeño superó a un modelo construido con precisión completa.

El error de la fotocopia
Cuando reduces un modelo, normalmente corriges sus errores comparándolo con la versión "a medio reducir": la que tiene 60 mil millones de perillas y mayor precisión. El problema es que el modelo intermedio ya es una copia borrosa del original. Así que le enseñas al modelo pequeño a imitar a un gemelo defectuoso. Nunca puede superar al gemelo.
Lo que estos investigadores llaman "Curación consciente de la cuantización" cambia el objetivo. Apunta al modelo pequeño de vuelta al original grande y sin comprimir, y le dice: copia las respuestas de este. El modelo pequeño aprende del maestro, no del intermedio turbio. En 7 de 9 pruebas, el modelo de 60 mil millones de parámetros de 4 bits superó al gemelo de 60 mil millones que se suponía que era su mejor mitad. El verdadero modelo de 120 mil millones de parámetros todavía gana la mayoría de las rondas: el tamaño no ha sido abolido, pero la versión "dieta" superó un listón que nadie creía que pudiera superar.

Más pequeño y más inteligente es un gran avance porque la IA consume hardware. El modelo curado necesita aproximadamente una cuarta parte de la memoria y la mitad de los parámetros del original. Esa es la diferencia entre una IA que vive en un centro de datos y una que cabe en un escritorio decente—o, eventualmente, en tu teléfono.
Así que un modelo que puede producir mejores resultados mientras consume la mitad de energía significa mucho para pequeños laboratorios y desarrolladores locales.
También es gratuito. El equipo lanzó el modelo curado Hypernova-60B con pesos abiertos en Hugging Face, por lo que cualquiera puede descargarlo y ejecutarlo. Esto se suma a una racha de modelos abiertos que superan barreras sorprendentes: un misterioso modelo gratuito, Ox Alpha, recientemente venció a un sistema Claude sin un constructor conocido detrás, el hype en torno a Alibaba's Qwen 3.8 Flash Next, y la ola de ajustes finos que mejoran modelos pequeños usando trazas de razonamiento de LLMs más grandes como Fable o Claude Opus.
Sin embargo, no te excedas. La herramienta de reducción que crea el estudiante de 60B es propietaria, por lo que la receta no está completamente abierta, y el equipo solo probó GPT-OSS—no las familias Llama, Qwen o Mistral.






