EnglishРусский Map

Qwen4: архитектура будущего (Qwen3.8-Flash-Next)

title
Qwen4: архитектура будущего (Qwen3.8-Flash-Next)
type
summary
summary
Статья на Хабре от gptunnel о Qwen3.8-Flash-Next - открытом превью архитектуры Qwen4; сам Qwen4 ещё не вышел
tags
llm, qwen, mixture-of-experts, linear-attention, local-llm, open-weights
created
2026-09-14
updated
2026-09-14
lang
ru
translation_of
qwen3-8-flash-next
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

26 августа 2026 года команда Qwen выпустила мультимодальную MoE-модель с открытыми весами, назвав её "экспериментальным превью архитектуры, которая ляжет в основу Qwen4". В русскоязычной статье на Хабре, опубликованной 30 августа 2026 года автором Master_AI в корпоративном блоге gptunnel, разбираются архитектура, бенчмарки и серия локальных запусков habr-gptunnel-1076382. gptunnel занимается перепродажей API к моделям. Ссылки в статье на "Qwen3.8 Max", "Opus" и, в последней строке, "Qwen4" ведут на собственные страницы моделей gptunnel с параметром utm_medium=seo, причём ссылка на "Qwen4" открывает страницу Qwen3.8-Max, поскольку продавать Qwen4 пока попросту невозможно. Текст стоит воспринимать как маркетинг, попутно содержащий техническую сводку.

В одном статья сразу и заглавными буквами оказывается права: Qwen4 не существует. Нет ни весов, ни model card, ни даты выхода, есть лишь слухи про окно в сентябре 2026 года. Модель везде называют по-разному. В цитируемом анонсе фигурирует "Qwen3.8-Flash", в остальном тексте статьи - Qwen3.8-Flash-Next, а страница Unsloth по ссылке озаглавлена "qwen3.8-next". В ней 125 миллиардов параметров плюс ещё 51 миллиард в отдельном слое эмбеддингов, при 6 миллиардах активных на токен.

Статья сравнивает релиз с прецедентом: Qwen3-Next был промежуточным релизом, обкатавшим гибрид Gated DeltaNet и gated attention, который затем вошёл во все модели от Qwen3.5 до Qwen3.8 Max. Даты этого прецедента в статье противоречат друг другу: Qwen3-Next относят одновременно и к "полутора годам назад", и к февралю 2026 года рядом с Qwen3.5. Родословная линейки ведёт от Tongyi Qianwen на архитектуре Llama в апреле 2023 года через Qwen3 в апреле 2025 года (гибридный thinking, 235B-A22B, обученная на 36 триллионах токенов на 119 языках) к Qwen3.8-Max на 2,4 триллиона параметров от 3 августа 2026 года, которую статья называет второй по величине открытой моделью после kimi-k3, и dense-модели Qwen3.8-27B под Apache 2.0 одиннадцатью днями позже.

Четыре изменения

В официальном блоге, согласно пересказу в статье, описаны изменения по четырём направлениям: attention, residual, эмбеддинги и оптимизация.

Механизм attention стал гибридным. 48 слоёв сгруппированы в 12 одинаковых блоков, каждый из которых содержит три слоя Gated DeltaNet, сжимающих историю в состояние фиксированного размера (семейство DeltaNet описано в kimi-delta-attention), и один слой полного attention, проходящий через новый Qwen Sparse Attention. Если DSA у DeepSeek оценивает каждый токен, то легковесный индексатор QSA сжимает ключи в микро-блоки с коэффициентом 4, оставляет топ-512 блоков (примерно 2051 логическая позиция токенов) и вычисляет финальный softmax по исходным несжатым ключам и значениям. Для контекста в 1M токенов статья указывает ускорение ядра QSA до 7,6 раза на prefill и до 4,9 раза на decode, а при 90% попаданий в кэш - пропускную способность prefill в 8,6 раза выше, чем у Qwen3.7-Plus.

Gated Residual расширяет residual-поток до четырёх параллельных веток с поэлементным динамическим гейтом, определяющим, какую долю каждый слой считывает из каждой ветки и записывает в неё. Одна из веток сама собой превратилась в прямую магистраль от первого слоя attention к большинству последующих слоёв, хотя специально это не закладывалось. Состояние потока можно хранить в FP8.

N-gram-эмбеддинг сопоставляет текущий токен и несколько предыдущих с таблицей примерно на 20 миллионов биграмм и триграмм, ссылаясь на Per-Layer Embedding из Gemma 3n и Engram от DeepSeek. Поскольку позиции поиска можно вычислить заранее, таблица может находиться в оперативной памяти хоста и подгружаться асинхронно, а не занимать VRAM. Статья приводит, а затем уточняет лозунг "работает как 6B, знает как 180B": этим параметрам почти не нужны вычисления, но их всё равно нужно где-то хранить, так что экономия достигается по вычислениям, а не по памяти. Это согласуется с factual-capacity-scaling, где сохранённые знания требуют параметров вне зависимости от дешевизны их чтения.

В обучении перешли с AdamW на Muon, оставив AdamW для эмбеддингов и MoE-роутера. Команда также выяснила, что разогрев размера батча (batch-size warmup) больше не даёт пользы и лишь отнимает на 18,8% больше шагов оптимизатора без прироста качества, поэтому итоговый рецепт стартует сразу с целевого размера батча.

Бенчмарки

Официальное сравнение проводится с Qwen3.7-Plus (май 2026), DeepSeek-V4-Flash-0731 (июль 2026) и Claude Opus 4.6 в режиме максимальных усилий (февраль 2026). Набор для сравнения подбирала команда Qwen, и модели Claude в нём на момент релиза было уже полгода.

Бенчмарк Qwen3.8-Flash-Next Qwen3.7-Plus DeepSeek-V4-Flash-0731 Opus 4.6 (max)
SWE-bench Pro 62.5 55.8 56.0 53.4
SWE-bench Multilingual 81.0 75.8 - 77.5
DeepSWE 1.1 58.7 16.5 54.4 -
CoWorkBench 73.9 65.1 45.1 68.2
JobBench 55.7 27.6 41.3 36.6
GPQA Diamond 91.7 90.3 90.8 91.3
LiveCodeBench v6 91.9 89.6 90.6 88.8
HLE 35.9 34.7 33.8 40.0

Opus 4.6 сохраняет лидерство в Humanity's Last Exam. В визуальных и агентских задачах статья приводит для Qwen 84,5 против 62 на AndroidWorld, 88,5 против 73,9 на RealWorldQA и 95,7 против 65,5 на MathVision. Artificial Analysis даёт модели 56 баллов в своём Intelligence Index при медиане по классу 29, отмечая её крайнюю многословность: 200 миллионов токенов на прогон индекса против медианных 110 миллионов. Эта многословность неизбежно проявляется в любых сравнениях стоимости на задачу, вроде описанного в intelligence-vs-cost-linear.

В тот же день Zhipu выпустила GLM-5.3-Flash. Сравнение из статьи: 320B всего и 18B активных против 125B/6B у Qwen; нативный контекст 1M против 262K (1M с YaRN); DeepSWE 63,4 против 58,7; цена за ввод по акции около $0,075 за миллион токенов против $0,16. GLM выигрывает по DeepSWE и контексту, но именно трёхкратно меньшее число активных параметров у Qwen позволяет запускать её на домашней машине.

Статья также ссылается на обсуждение в Hugging Face, где отмечается заметное ухудшение качества работы с русским языком по сравнению с ранними моделями Qwen - эту проблему отслеживают ещё с версии 3.5.

Локальный запуск

Таблица требований к памяти от Unsloth в цитате статьи: 75 ГБ для 1 бит, 79 ГБ для 2 бит, 90 ГБ для 3 бит, 112 ГБ для 4 бит, 200 ГБ для 5 бит, 270 ГБ для 8 бит, 355 ГБ для BF16. 1-битная сборка весит намного больше ожидаемых наивных ~22 ГБ, потому что n-gram-таблица чувствительна к точности поиска и никогда не квантуется ниже 4 бит. В этой сборке MoE-эксперты занимают 37,11 ГБ (54,9%), n-gram-таблица - 26,82 ГБ (39,7%), attention и QSA - 1,71 ГБ, а всё остальное - 1,91 ГБ, то есть почти 40% файла уходит на единственное копирование через GGML_OP_GET_ROWS, не выполняющее никакой арифметики. Семейства квантования рассмотрены в unsloth и llm-quantization.

Кто именно проводил следующие тесты, в статье не уточняется. На Core Ultra 9 285K с 24 ядрами, 95,3 ГБ оперативной памяти и без GPU генерация вышла на плато примерно в 11 токенов в секунду начиная с 8 потоков, тогда как prefill масштабировался до 53 токенов/с на 24 потоках, показав, что decode упирается в скорость памяти, а prefill - в вычислительную мощность. Добавление одной RTX 5090 (32 ГБ) подняло скорость генерации до 52 токенов/с за счёт закрепления n-gram-таблицы в оперативной памяти системы и постепенного переноса слоёв экспертов на видеокарту:

-ot per_layer_token_embd=CPU   # keep the n-gram table in host RAM
-ncmoe N                       # number of MoE layers whose experts stay on CPU

Стоило перенести на один блок слоёв больше, и скорость падала с 52 до 3,7 токена/с без каких-либо сообщений об ошибках, поскольку драйвер начинал сбрасывать излишки VRAM в системную память через PCIe. Правило статьи: если настройка, которая должна быть быстрее, работает медленнее, в первую очередь подозревайте переполнение VRAM. Это тот самый компромисс выгрузки (offload), о котором рассказывают moe-cpu-offload и habr-local-llm-quantization-deep-dive, усугубляемый тем, что сбой происходит молча. На контексте в 32K генерация замедлялась на 15 - 17%.

По перплексии на wikitext-2 1-битная сборка Flash-Next набрала 4,01 против 5,68 у 4-битной Qwen3.8-27B. Здесь сравниваются две разные модели, так что это отражает соотношение сил, а не потери квантования при прочих равных. На 12 практических задачах четыре из пяти сборок набрали идеальные 1,000, а 1-битная 27B просела до 0,309: на вопрос о том, кто изобрёл транзистор, эта сборка 27B назвала трёх несуществующих учёных и ошиблась с датой на 22 года, тогда как 1-битная Flash-Next ответила правильно.

Главное

Если отбросить бенчмарки, главная мысль статьи остаётся верной: стоимость токена снижается не только за счёт "железа", но и благодаря архитектуре - через разделение памяти на дешёвое адресуемое хранилище и дорогие вычисления, обработку attention только для отдельных фрагментов и расширение residual-потока в ширину вместо наращивания глубины. Будет ли этот дизайн использоваться в Qwen4, пока остаётся заявленным намерением команды Qwen, а не свершившимся релизом. О том, насколько локальные модели Qwen далеки на практике от передовых (frontier), см. local-ai-is-not-opus; свидетельства того, откуда берутся цепочки рассуждений в Qwen3.8, разобраны в qwen-gpt-reasoning-prefills; общее разделение между полным и активным числом параметров описано в mixture-of-experts.