Qwen4: архитектура будущего (Qwen3.8-Flash-Next)
- title
- Qwen4: архитектура будущего (Qwen3.8-Flash-Next)
- type
- summary
- summary
- Статья на Хабре от gptunnel о Qwen3.8-Flash-Next - открытом превью архитектуры Qwen4; сам Qwen4 ещё не вышел
- tags
- llm, qwen, mixture-of-experts, linear-attention, local-llm, open-weights
- sources
- habr-gptunnel-1076382
- created
- 2026-09-14
- updated
- 2026-09-14
- lang
- ru
- translation_of
- qwen3-8-flash-next
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
26 августа 2026 года команда Qwen выпустила мультимодальную MoE-модель с открытыми весами, назвав её "экспериментальным превью архитектуры, которая ляжет в основу Qwen4". В русскоязычной статье на Хабре, опубликованной 30 августа 2026 года автором Master_AI в корпоративном блоге gptunnel, разбираются архитектура, бенчмарки и серия локальных запусков habr-gptunnel-1076382. gptunnel занимается перепродажей API к моделям. Ссылки в статье на "Qwen3.8 Max", "Opus" и, в последней строке, "Qwen4" ведут на собственные страницы моделей gptunnel с параметром utm_medium=seo, причём ссылка на "Qwen4" открывает страницу Qwen3.8-Max, поскольку продавать Qwen4 пока попросту невозможно. Текст стоит воспринимать как маркетинг, попутно содержащий техническую сводку.
В одном статья сразу и заглавными буквами оказывается права: Qwen4 не существует. Нет ни весов, ни model card, ни даты выхода, есть лишь слухи про окно в сентябре 2026 года. Модель везде называют по-разному. В цитируемом анонсе фигурирует "Qwen3.8-Flash", в остальном тексте статьи - Qwen3.8-Flash-Next, а страница Unsloth по ссылке озаглавлена "qwen3.8-next". В ней 125 миллиардов параметров плюс ещё 51 миллиард в отдельном слое эмбеддингов, при 6 миллиардах активных на токен.
Статья сравнивает релиз с прецедентом: Qwen3-Next был промежуточным релизом, обкатавшим гибрид Gated DeltaNet и gated attention, который затем вошёл во все модели от Qwen3.5 до Qwen3.8 Max. Даты этого прецедента в статье противоречат друг другу: Qwen3-Next относят одновременно и к "полутора годам назад", и к февралю 2026 года рядом с Qwen3.5. Родословная линейки ведёт от Tongyi Qianwen на архитектуре Llama в апреле 2023 года через Qwen3 в апреле 2025 года (гибридный thinking, 235B-A22B, обученная на 36 триллионах токенов на 119 языках) к Qwen3.8-Max на 2,4 триллиона параметров от 3 августа 2026 года, которую статья называет второй по величине открытой моделью после kimi-k3, и dense-модели Qwen3.8-27B под Apache 2.0 одиннадцатью днями позже.
Четыре изменения
В официальном блоге, согласно пересказу в статье, описаны изменения по четырём направлениям: attention, residual, эмбеддинги и оптимизация.
Механизм attention стал гибридным. 48 слоёв сгруппированы в 12 одинаковых блоков, каждый из которых содержит три слоя Gated DeltaNet, сжимающих историю в состояние фиксированного размера (семейство DeltaNet описано в kimi-delta-attention), и один слой полного attention, проходящий через новый Qwen Sparse Attention. Если DSA у DeepSeek оценивает каждый токен, то легковесный индексатор QSA сжимает ключи в микро-блоки с коэффициентом 4, оставляет топ-512 блоков (примерно 2051 логическая позиция токенов) и вычисляет финальный softmax по исходным несжатым ключам и значениям. Для контекста в 1M токенов статья указывает ускорение ядра QSA до 7,6 раза на prefill и до 4,9 раза на decode, а при 90% попаданий в кэш - пропускную способность prefill в 8,6 раза выше, чем у Qwen3.7-Plus.
Gated Residual расширяет residual-поток до четырёх параллельных веток с поэлементным динамическим гейтом, определяющим, какую долю каждый слой считывает из каждой ветки и записывает в неё. Одна из веток сама собой превратилась в прямую магистраль от первого слоя attention к большинству последующих слоёв, хотя специально это не закладывалось. Состояние потока можно хранить в FP8.
N-gram-эмбеддинг сопоставляет текущий токен и несколько предыдущих с таблицей примерно на 20 миллионов биграмм и триграмм, ссылаясь на Per-Layer Embedding из Gemma 3n и Engram от DeepSeek. Поскольку позиции поиска можно вычислить заранее, таблица может находиться в оперативной памяти хоста и подгружаться асинхронно, а не занимать VRAM. Статья приводит, а затем уточняет лозунг "работает как 6B, знает как 180B": этим параметрам почти не нужны вычисления, но их всё равно нужно где-то хранить, так что экономия достигается по вычислениям, а не по памяти. Это согласуется с factual-capacity-scaling, где сохранённые знания требуют параметров вне зависимости от дешевизны их чтения.
В обучении перешли с AdamW на Muon, оставив AdamW для эмбеддингов и MoE-роутера. Команда также выяснила, что разогрев размера батча (batch-size warmup) больше не даёт пользы и лишь отнимает на 18,8% больше шагов оптимизатора без прироста качества, поэтому итоговый рецепт стартует сразу с целевого размера батча.
Бенчмарки
Официальное сравнение проводится с Qwen3.7-Plus (май 2026), DeepSeek-V4-Flash-0731 (июль 2026) и Claude Opus 4.6 в режиме максимальных усилий (февраль 2026). Набор для сравнения подбирала команда Qwen, и модели Claude в нём на момент релиза было уже полгода.
| Бенчмарк | Qwen3.8-Flash-Next | Qwen3.7-Plus | DeepSeek-V4-Flash-0731 | Opus 4.6 (max) |
|---|---|---|---|---|
| SWE-bench Pro | 62.5 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 75.8 | - | 77.5 |
| DeepSWE 1.1 | 58.7 | 16.5 | 54.4 | - |
| CoWorkBench | 73.9 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 27.6 | 41.3 | 36.6 |
| GPQA Diamond | 91.7 | 90.3 | 90.8 | 91.3 |
| LiveCodeBench v6 | 91.9 | 89.6 | 90.6 | 88.8 |
| HLE | 35.9 | 34.7 | 33.8 | 40.0 |
Opus 4.6 сохраняет лидерство в Humanity's Last Exam. В визуальных и агентских задачах статья приводит для Qwen 84,5 против 62 на AndroidWorld, 88,5 против 73,9 на RealWorldQA и 95,7 против 65,5 на MathVision. Artificial Analysis даёт модели 56 баллов в своём Intelligence Index при медиане по классу 29, отмечая её крайнюю многословность: 200 миллионов токенов на прогон индекса против медианных 110 миллионов. Эта многословность неизбежно проявляется в любых сравнениях стоимости на задачу, вроде описанного в intelligence-vs-cost-linear.
В тот же день Zhipu выпустила GLM-5.3-Flash. Сравнение из статьи: 320B всего и 18B активных против 125B/6B у Qwen; нативный контекст 1M против 262K (1M с YaRN); DeepSWE 63,4 против 58,7; цена за ввод по акции около $0,075 за миллион токенов против $0,16. GLM выигрывает по DeepSWE и контексту, но именно трёхкратно меньшее число активных параметров у Qwen позволяет запускать её на домашней машине.
Статья также ссылается на обсуждение в Hugging Face, где отмечается заметное ухудшение качества работы с русским языком по сравнению с ранними моделями Qwen - эту проблему отслеживают ещё с версии 3.5.
Локальный запуск
Таблица требований к памяти от Unsloth в цитате статьи: 75 ГБ для 1 бит, 79 ГБ для 2 бит, 90 ГБ для 3 бит, 112 ГБ для 4 бит, 200 ГБ для 5 бит, 270 ГБ для 8 бит, 355 ГБ для BF16. 1-битная сборка весит намного больше ожидаемых наивных ~22 ГБ, потому что n-gram-таблица чувствительна к точности поиска и никогда не квантуется ниже 4 бит. В этой сборке MoE-эксперты занимают 37,11 ГБ (54,9%), n-gram-таблица - 26,82 ГБ (39,7%), attention и QSA - 1,71 ГБ, а всё остальное - 1,91 ГБ, то есть почти 40% файла уходит на единственное копирование через GGML_OP_GET_ROWS, не выполняющее никакой арифметики. Семейства квантования рассмотрены в unsloth и llm-quantization.
Кто именно проводил следующие тесты, в статье не уточняется. На Core Ultra 9 285K с 24 ядрами, 95,3 ГБ оперативной памяти и без GPU генерация вышла на плато примерно в 11 токенов в секунду начиная с 8 потоков, тогда как prefill масштабировался до 53 токенов/с на 24 потоках, показав, что decode упирается в скорость памяти, а prefill - в вычислительную мощность. Добавление одной RTX 5090 (32 ГБ) подняло скорость генерации до 52 токенов/с за счёт закрепления n-gram-таблицы в оперативной памяти системы и постепенного переноса слоёв экспертов на видеокарту:
-ot per_layer_token_embd=CPU # keep the n-gram table in host RAM
-ncmoe N # number of MoE layers whose experts stay on CPU
Стоило перенести на один блок слоёв больше, и скорость падала с 52 до 3,7 токена/с без каких-либо сообщений об ошибках, поскольку драйвер начинал сбрасывать излишки VRAM в системную память через PCIe. Правило статьи: если настройка, которая должна быть быстрее, работает медленнее, в первую очередь подозревайте переполнение VRAM. Это тот самый компромисс выгрузки (offload), о котором рассказывают moe-cpu-offload и habr-local-llm-quantization-deep-dive, усугубляемый тем, что сбой происходит молча. На контексте в 32K генерация замедлялась на 15 - 17%.
По перплексии на wikitext-2 1-битная сборка Flash-Next набрала 4,01 против 5,68 у 4-битной Qwen3.8-27B. Здесь сравниваются две разные модели, так что это отражает соотношение сил, а не потери квантования при прочих равных. На 12 практических задачах четыре из пяти сборок набрали идеальные 1,000, а 1-битная 27B просела до 0,309: на вопрос о том, кто изобрёл транзистор, эта сборка 27B назвала трёх несуществующих учёных и ошиблась с датой на 22 года, тогда как 1-битная Flash-Next ответила правильно.
Главное
Если отбросить бенчмарки, главная мысль статьи остаётся верной: стоимость токена снижается не только за счёт "железа", но и благодаря архитектуре - через разделение памяти на дешёвое адресуемое хранилище и дорогие вычисления, обработку attention только для отдельных фрагментов и расширение residual-потока в ширину вместо наращивания глубины. Будет ли этот дизайн использоваться в Qwen4, пока остаётся заявленным намерением команды Qwen, а не свершившимся релизом. О том, насколько локальные модели Qwen далеки на практике от передовых (frontier), см. local-ai-is-not-opus; свидетельства того, откуда берутся цепочки рассуждений в Qwen3.8, разобраны в qwen-gpt-reasoning-prefills; общее разделение между полным и активным числом параметров описано в mixture-of-experts.