W skrócie

  • Zespół Qwen z Alibaba ma opublikować w środę model Qwen 3.8-Flash-Next, model Mixture-of-Experts opisany jako zapowiedź architektury Qwen4.
  • W materiałach przedpremierowych zespół podaje łącznie 125 miliardów parametrów, z czego tylko 6 miliardów aktywnych na token.
  • Wyniki twardych benchmarków nie zostały jeszcze opublikowane, a wagi nie są dostępne na ModelScope w momencie pisania tego tekstu.

Alibaba ma opublikować w środę model Qwen 3.8-Flash-Next, model o 125 miliardach parametrów, który aktywuje tylko 6 miliardów na token. Zespół Qwen przedstawił go jako zapowiedź architektury nowej generacji Qwen 4, a nie gotowy flagowy model.

Nie ma oficjalnych informacji na temat modelu, ale na podstawie plotek, prawdopodobnie będzie to system mixture-of-experts, czyli architektura, która dzieli sieć na wiele wyspecjalizowanych podmodeli i uruchamia tylko te istotne dla danego zadania. Model o 125 miliardach parametrów działałby zatem z kosztem obliczeniowym modelu o zaledwie 6 miliardach parametrów.