Mixture of Experts (MoE)
- title
- Mixture of Experts (MoE)
- type
- concept
- summary
- Архитектура, где роутер активирует подмножество экспертов на токен: разделяет общий объём параметров и вычисления, меняя экономику локального инференса
- tags
- llm, local-models, architecture
- sources
- habr-local-llm-16gb-vram-gemma-qwen, ikp-incompressible-knowledge-probes, habr-local-llm-quantization-deep-dive
- created
- 2026-05-13
- updated
- 2026-09-14
- lang
- ru
- translation_of
- mixture-of-experts
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Mixture of Experts (MoE) - архитектура LLM, где каждый слой содержит множество параллельных подсетей ("экспертов"), а компактный роутер выбирает несколько из них для каждого токена. Общее число параметров и число активных параметров - разные величины. У модели формата 35B-A3B всего 35 миллиардов весов, но в каждом прямом проходе (forward pass) участвует лишь около 3 миллиардов.
Такое разделение важно, поскольку оно отвязывает ёмкость модели от вычислительных затрат. Роутер и активные эксперты должны находиться в быстрой памяти, чтобы генерация оставалась отзывчивой. Неактивные эксперты могут лежать где угодно - в системной RAM, на SSD или даже в сети - при условии, что они успевают попасть в GPU до того, как понадобятся. Полносвязные (dense) модели так делать не могут: в них каждый вес задействован на каждом токене.
Почему цифра в заголовке обманчива
Сравнивать MoE-модели по общему числу параметров некорректно. Три модели из тестов Вячеслава:
| Модель | Всего | Активных | Шаблон |
|---|---|---|---|
| Gemma 4 | 26B | ~4B | 26B-A4B |
| Qwen 3.6 | 35B | ~3B | 35B-A3B |
| Qwen3-Coder | 30B | ~3B | 30B-A3B |
У Gemma 4 наименьшее общее число параметров, но наибольшее количество активных. В тестах на написание кода Вячеслава она также показала лучшие результаты, что указывает на то, что архитектура и бюджет активных параметров значат больше, чем общий объём весов.
Что MoE даёт локальному инференсу
Две вещи, критически важные для потребительского железа:
- Меньше вычислений на токен - работают только активные эксперты, поэтому модель на 30B генерирует со скоростью, близкой к плотной модели на 3B.
- Выборочный сброс (offload) - неактивные эксперты могут жить в медленной памяти, не блокируя генерацию. Именно это позволяет работать параметру
llama.cpp --n-cpu-moe; см. moe-cpu-offload.
Минус в том, что веса всех экспертов всё равно нужно куда-то загрузить. MoE на 30B при квантовании Q4 помещается в 16 GB VRAM ничуть не проще, чем плотная модель на 30B, - она просто даёт рабочий способ выгрузить холодные части.
Чего MoE не даёт
- Роутер не "умён" в человеческом понимании. Он учится активировать нужных экспертов в процессе обучения; вручную выбирать или интерпретировать их не получится.
- Некоторые MoE-архитектуры плохо уживаются с форматами квантования. Кванты Dynamic 2.0 от Unsloth деградируют на Qwen MoE сильнее, чем на плотных моделях, поскольку агрессивная 4-битная компрессия сталкивается с чувствительностью роутера к малейшим искажениям весов. См. llm-quantization.
- Длинные последовательности и редактирование больших файлов создают для MoE бóльшую нагрузку, чем для плотных моделей: по мере роста контекста маршрутизация экспертов может непредсказуемо смещаться. Это одна из замеченных причин нестабильной работы Qwen в длинных сессиях в local-llm-16gb-vram-tests.
Объём знаний зависит от общего числа параметров, а не от активных
Статья Боцзе Ли (Bojie Li) по IKP (апрель 2026 года) сопоставляет фактологическую ёмкость с количеством параметров на выборке из 37 MoE-моделей. Общее число параметров предсказывает объём знаний (R² = 0.79), а число активных параметров - нет (R² = 0.51). Фактические знания распределены по весам всех экспертов, а не только тех, к которым направляется каждый отдельный токен. Это подтверждает эмпирическую догадку, у которой раньше не было строгого обоснования: когда вы видите "DeepSeek-V3 - модель на 671B параметров, из которых активны 37B", именно число 671B правильно сравнивать с плотной моделью на 671B для оценки знаний, тогда как 37B - корректная база для оценки вычислительных затрат на инференс.
Следствие: прунинг экспертов методом REAP (reap-expert-pruning) разменивает фактологическую ёмкость на компактность с измеримой скоростью. Удаление 20% экспертов снижает как объём вычислений, так и реальный запас фактов, сохранённых в модели.
Заметные MoE-модели в этой вики
- Gemma 4 26B-A4B - MoE от Google; неожиданный победитель local-llm-16gb-vram-tests.
- Qwen 3.6 35B-A3B - поколение рассуждающих моделей от Alibaba.
- Qwen3-Coder 30B-A3B - специализированный вариант для работы с кодом.
- Qwen3.8-Flash-Next - 125B параметров всего, 6B активных, плюс отдельная таблица n-граммных эмбеддингов на 51B, которая может находиться в оперативной памяти хоста, так как выборка из неё почти не требует вычислений; qwen3-8-flash-next.
- DeepSeek V3 / R1 / V4 - линейка, доказавшая экономическую эффективность MoE в больших масштабах; см. deepseek.
- Kimi K3 2.8T - 896 экспертов на слой, маршрутизация top-16, крупнейшая MoE с открытыми весами на данный момент; см. kimi-k3 об архитектуре и deltafin о стоимости её запуска.
- OLMoE - полностью открытая MoE от Ai2, опубликованная вместе с данными и кодом обучения, как и плотные модели семейства olmo.
Статистике популярности тоже приходится выбирать одно из двух чисел. В atom-report-open-model-ecosystem MoE-модели группируются по общему числу параметров при сравнении загрузок по весовым категориям.
- Nathan Lambert on China's AI Ecosystem and the Open Model Gap
- CrofAI
- deltafin
- llama.cpp
- local-llm (jamesob)
- Petals
- The ATOM Project: American Truly Open Models
- The ATOM Report: Measuring the Open Language Model Ecosystem
- BF16 vs FP16
- Evaluating Quantized Models for Deployment
- Factual Capacity Scaling
- GLM5.2 on AMD MI355X
- Local LLMs Deep Dive — Quants, MoE Offload, REAP, ik_llama, Speculative Decoding
- Incompressible Knowledge Probes (IKP)
- Kimi K3: The open-weights escalation
- Kimi K3
- KV Cache Sizing
- little-coder — Scaffold-Model Fit on Aider Polyglot
- LLM Quantization Formats
- Coding-Agent Tests of Local LLMs on 16 GB VRAM
- MoE CPU Offload (`--n-cpu-moe`)
- Olmo
- Pine AI
- Qwen4: The Architecture of the Future (Qwen3.8-Flash-Next)
- Random-Rotation Quantization
- REAP — Router-weighted Expert Activation Pruning
- Unsloth