Kurzfassung
- Alibabas Qwen-Team wird am Mittwoch Qwen 3.8-Flash-Next veröffentlichen, ein Mixture-of-Experts-Modell, das als Vorschau auf die Qwen4-Architektur beschrieben wird.
- In der Vorab-Briefing des Teams werden insgesamt 125 Milliarden Parameter genannt, von denen pro Token nur 6 Milliarden aktiv sind.
- Harte Benchmark-Ergebnisse wurden noch nicht veröffentlicht, und die Gewichte sind zum Zeitpunkt dieses Schreibens noch nicht auf ModelScope verfügbar.
Alibaba wird am Mittwoch Qwen 3.8-Flash-Next veröffentlichen, ein Modell mit 125 Milliarden Parametern, das pro Token nur 6 Milliarden aktiviert. Das Qwen-Team stellte es als Vorschau auf die nächste Generation der Qwen-4-Architektur dar, nicht als fertiges Flaggschiff.
Es gibt keine offiziellen Informationen über das Modell, aber basierend auf Gerüchten wird es wahrscheinlich ein Mixture-of-Experts-System sein, ein Design, das das Netzwerk in viele spezialisierte Teilmodelle aufteilt und für jede Aufgabe nur die relevanten aktiviert. Ein Modell mit 125 Milliarden Parametern würde also mit den Rechenkosten eines Modells mit nur 6 Milliarden Parametern laufen.

Parameter sind im Grunde alle Einstellräder, die ein Modell justieren kann. Je mehr Parameter, desto leistungsfähiger ist ein Modell und desto mehr Rechenleistung benötigt es. Ein Mixture of Experts ermöglicht es einem extrem leistungsfähigen Modell, nur das zu aktivieren, was es benötigt, um die beste Ausgabe zu liefern, ohne Ressourcen zu verschwenden.
Qwen 3.8 Flash Next wird morgen veröffentlicht. 125B Parameter + 51B N-Gramm und 6B aktiv. Es basiert auf der nächsten Generation der Qwen-4-Architektur.
Qwen 4 kommt https://t.co/xduZNdKnKUpic.twitter.com/rAcBZlNwKs
— AiBattle (@AiBattle_) 25. August 2026
Das Qwen-Team von Alibaba beschreibt das Modell tatsächlich als multimodal und auf der kommenden Qwen-4-Architektur basierend und sagt, dass es den frühen Build ausgeliefert hat, damit Entwickler sich auf die vollständige Familie vorbereiten können.
Warum die "3.8" nicht die Neuigkeit ist

Alibaba hat einen Teaser veröffentlicht, obwohl das Team es als Vorschau bezeichnet. Der Plan ist, die Architekturverbesserungen jetzt auszuliefern, vor dem vollständigen Qwen-4-Rollout. Hugging Face, wo auch die Gewichte liegen, beschreibt es ebenfalls als "eine Vorschau der Qwen-4-Architektur."
Harte Benchmarks sind noch nicht veröffentlicht. Qwen hat keine direkten Vergleichswerte gegen die eigene Qwen-3-Linie oder westliche Konkurrenten veröffentlicht, daher sind die 125 Milliarden und 6 Milliarden Parameterzahlen nicht verifiziert, und wir können nur über die Leistung spekulieren.
Chinas offene Gewichtskadenz war unerbittlich. Ein mysteriöses kostenloses Modell, Ox Alpha, hat kürzlich Anthropics Fable bei bestimmten Codierungs-Benchmarks geschlagen, ohne bekannten Entwickler dahinter. Alibaba, DeepSeek und Moonshot haben alle leistungsfähige Gewichte veröffentlicht, die jeder herunterladen, feinabstimmen und ausführen kann.
Offene Gewichte ermöglichen es Entwicklern, zu bauen, ohne Daten an eine geschlossene API zu senden, und sie unterbieten die Kosten von gehosteten Modellen. Deshalb ist ein offenes 125-Milliarden-Parameter-Modell mit 6 Milliarden aktiven Parametern wichtig: Es bringt nahezu Spitzenfähigkeiten auf handelsübliche Hardware.
Aber wir müssen auf die Zahlen warten. Qwen hatte zum Zeitpunkt dieses Schreibens keine Benchmark-Ergebnisse für die Veröffentlichung veröffentlicht.






