En bref

  • L'équipe Qwen d'Alibaba doit publier Qwen 3.8-Flash-Next mercredi, un modèle Mixture-of-Experts décrit comme un aperçu de l'architecture Qwen4.
  • Le briefing préalable à la publication de l'équipe mentionne 125 milliards de paramètres au total avec seulement 6 milliards actifs par jeton.
  • Les scores de référence durs n'ont pas encore été publiés, et les poids ne sont pas en ligne sur ModelScope au moment de la rédaction.

Alibaba doit publier Qwen 3.8-Flash-Next mercredi, un modèle de 125 milliards de paramètres qui n'active que 6 milliards par jeton. L'équipe Qwen l'a présenté comme un aperçu de l'architecture de nouvelle génération Qwen 4, et non comme un produit phare terminé.

Il n'y a pas d'informations officielles sur le modèle, mais d'après des rumeurs, il s'agira probablement d'un système de mixture-of-experts, une conception qui divise le réseau en de nombreux sous-modèles spécialisés et n'active que ceux pertinents pour chaque tâche. Un modèle de 125 milliards de paramètres fonctionnerait ainsi avec la facture de calcul d'un modèle de seulement 6 milliards de paramètres.