Коротко

  • Команда Qwen від Alibaba планує випустити Qwen 3.8-Flash-Next у середу, модель Mixture-of-Experts, яку описують як попередній перегляд архітектури Qwen4.
  • У попередньому брифінгу команди зазначено 125 мільярдів загальних параметрів, з яких лише 6 мільярдів активуються на кожен токен.
  • Тверді результати бенчмарків ще не опубліковані, і ваги не доступні на ModelScope на момент написання цього тексту.

Alibaba планує випустити Qwen 3.8-Flash-Next у середу, модель з 125 мільярдами параметрів, яка активує лише 6 мільярдів на токен. Команда Qwen представила її як попередній перегляд архітектури наступного покоління Qwen 4, а не як готовий флагман.

Офіційної інформації про модель немає, але на основі чуток, це, ймовірно, буде система mixture-of-experts, дизайн, який розділяє мережу на багато спеціалізованих підмоделей і активує лише відповідні для кожного завдання. Таким чином, модель з 125 мільярдами параметрів працюватиме з обчислювальними витратами моделі лише з 6 мільярдами параметрів.