En bref
- L'équipe Qwen d'Alibaba doit publier Qwen 3.8-Flash-Next mercredi, un modèle Mixture-of-Experts décrit comme un aperçu de l'architecture Qwen4.
- Le briefing préalable à la publication de l'équipe mentionne 125 milliards de paramètres au total avec seulement 6 milliards actifs par jeton.
- Les scores de référence durs n'ont pas encore été publiés, et les poids ne sont pas en ligne sur ModelScope au moment de la rédaction.
Alibaba doit publier Qwen 3.8-Flash-Next mercredi, un modèle de 125 milliards de paramètres qui n'active que 6 milliards par jeton. L'équipe Qwen l'a présenté comme un aperçu de l'architecture de nouvelle génération Qwen 4, et non comme un produit phare terminé.
Il n'y a pas d'informations officielles sur le modèle, mais d'après des rumeurs, il s'agira probablement d'un système de mixture-of-experts, une conception qui divise le réseau en de nombreux sous-modèles spécialisés et n'active que ceux pertinents pour chaque tâche. Un modèle de 125 milliards de paramètres fonctionnerait ainsi avec la facture de calcul d'un modèle de seulement 6 milliards de paramètres.

Les paramètres sont essentiellement tous les boutons qu'un modèle peut ajuster. Plus il y a de paramètres, plus le modèle est performant et plus il nécessite de puissance de calcul. Un mélange d'experts permet à un modèle extrêmement puissant de n'activer que ce dont il a besoin pour fournir le meilleur résultat sans gaspiller de ressources.
Qwen 3.8 Flash Next sort demain. 125B paramètres + 51B N-gram et 6B actifs. Il est basé sur l'architecture de la prochaine génération Qwen 4.
Qwen 4 arrive https://t.co/xduZNdKnKUpic.twitter.com/rAcBZlNwKs
— AiBattle (@AiBattle_) 25 août 2026
L'équipe Qwen d'Alibaba décrit le modèle comme multimodal et construit sur la prochaine architecture Qwen 4, et indique qu'elle a expédié la version préliminaire afin que les développeurs puissent se préparer pour la famille complète.
Pourquoi le « 3.8 » n'est pas la nouvelle

Alibaba a publié un teaser, bien que l'équipe l'appelle un aperçu. Le plan est de livrer les améliorations d'architecture maintenant, avant le déploiement complet de Qwen 4. Hugging Face, où les poids sont également hébergés, le décrit également comme « un aperçu de l'architecture Qwen 4 ».
Les benchmarks officiels ne sont pas encore publiés. Qwen n'a pas publié de scores comparatifs avec sa propre gamme Qwen 3 ou avec ses rivaux occidentaux, donc les chiffres de 125 milliards et 6 milliards de paramètres ne sont pas vérifiés, et nous ne pouvons que spéculer sur ses performances.
Le rythme des poids ouverts en Chine est incessant. Un mystérieux modèle gratuit, Ox Alpha, a récemment battu Fable d'Anthropic sur certains benchmarks de codage, sans constructeur connu derrière lui. Alibaba, DeepSeek et Moonshot ont tous publié des poids performants que tout le monde peut télécharger, affiner et exécuter.
Les poids ouverts permettent aux développeurs de créer sans envoyer de données à une API fermée, et ils réduisent le coût des modèles hébergés. C'est pourquoi un modèle ouvert de 125 milliards de paramètres avec 6 milliards de paramètres actifs est important : il place une capacité proche de la frontière sur du matériel standard.
Mais nous devrons attendre les chiffres. Qwen n'avait pas publié de scores de benchmark pour cette version au moment de la rédaction.






