Alibaba представила Qwen3.8-Flash-Next — мультимодальную модель, которая стала предварительным показом архитектуры Qwen4. Компания делает ставку на высокую производительность при низкой стоимости обучения и запуска.
Модель построена по схеме Mixture of Experts. Всего у неё 125 млрд параметров, но при обработке каждого токена работают только 6 млрд. Для сравнения, Qwen3.7-Plus активирует 17 млрд параметров из 397 млрд.
Из общего числа параметров 51 млрд находятся в новом слое N-gram embeddings. Он хранит распространённые группы слов как отдельные записи — своего рода словарь фраз. Этот слой можно держать в обычной оперативной памяти, не занимая дорогую память графического ускорителя.
Qwen3.8-Flash-Next изначально поддерживает контекст на 262 144 токена. С технологией YaRN его можно расширить до миллиона токенов. Технический отчёт опубликован на GitHub, а веса модели доступны на Hugging Face и ModelScope.
По данным Alibaba, новинка превзошла Qwen3.7-Plus при примерно девятикратно меньших затратах на обучение. Самые заметные результаты получены в тестах на программирование и офисные задачи.
В агентном тесте DeepSWE модель набрала 58,7 балла против 54,4 у DeepSeek-V4-Flash. В SWE-bench Pro результат составил 62,5 балла против 56 у DeepSeek-V4-Flash и 53,4 у Claude Opus 4.6. В CoWorkBench новинка получила 73,9 балла против 45,1 у DeepSeek-V4-Flash. На JobBench результат составил 55,7 балла — почти вдвое больше 27,6 балла у Qwen3.7-Plus.
Результаты собственных тестов производителя не гарантируют такого же преимущества в реальной работе. На Humanity’s Last Exam модель уступила Claude Opus 4.6, набрав 35,9 против 40 баллов.
Коммерческая версия выйдет в QwenCloud под названием Qwen3.8-Flash. Миллион входных токенов будет стоить $0,16, выходных — $0,47. Это примерно в 12 раз дешевле флагманской Qwen3.8-Max.