EnglishРусский Map

Mixture of Experts (MoE)

title
Mixture of Experts (MoE)
type
concept
summary
Архитектура, где роутер активирует подмножество экспертов на токен: разделяет общий объём параметров и вычисления, меняя экономику локального инференса
tags
llm, local-models, architecture
created
2026-05-13
updated
2026-09-14
lang
ru
translation_of
mixture-of-experts
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Mixture of Experts (MoE) - архитектура LLM, где каждый слой содержит множество параллельных подсетей ("экспертов"), а компактный роутер выбирает несколько из них для каждого токена. Общее число параметров и число активных параметров - разные величины. У модели формата 35B-A3B всего 35 миллиардов весов, но в каждом прямом проходе (forward pass) участвует лишь около 3 миллиардов.

Такое разделение важно, поскольку оно отвязывает ёмкость модели от вычислительных затрат. Роутер и активные эксперты должны находиться в быстрой памяти, чтобы генерация оставалась отзывчивой. Неактивные эксперты могут лежать где угодно - в системной RAM, на SSD или даже в сети - при условии, что они успевают попасть в GPU до того, как понадобятся. Полносвязные (dense) модели так делать не могут: в них каждый вес задействован на каждом токене.

Почему цифра в заголовке обманчива

Сравнивать MoE-модели по общему числу параметров некорректно. Три модели из тестов Вячеслава:

Модель Всего Активных Шаблон
Gemma 4 26B ~4B 26B-A4B
Qwen 3.6 35B ~3B 35B-A3B
Qwen3-Coder 30B ~3B 30B-A3B

У Gemma 4 наименьшее общее число параметров, но наибольшее количество активных. В тестах на написание кода Вячеслава она также показала лучшие результаты, что указывает на то, что архитектура и бюджет активных параметров значат больше, чем общий объём весов.

Что MoE даёт локальному инференсу

Две вещи, критически важные для потребительского железа:

  1. Меньше вычислений на токен - работают только активные эксперты, поэтому модель на 30B генерирует со скоростью, близкой к плотной модели на 3B.
  2. Выборочный сброс (offload) - неактивные эксперты могут жить в медленной памяти, не блокируя генерацию. Именно это позволяет работать параметру llama.cpp --n-cpu-moe; см. moe-cpu-offload.

Минус в том, что веса всех экспертов всё равно нужно куда-то загрузить. MoE на 30B при квантовании Q4 помещается в 16 GB VRAM ничуть не проще, чем плотная модель на 30B, - она просто даёт рабочий способ выгрузить холодные части.

Чего MoE не даёт

  • Роутер не "умён" в человеческом понимании. Он учится активировать нужных экспертов в процессе обучения; вручную выбирать или интерпретировать их не получится.
  • Некоторые MoE-архитектуры плохо уживаются с форматами квантования. Кванты Dynamic 2.0 от Unsloth деградируют на Qwen MoE сильнее, чем на плотных моделях, поскольку агрессивная 4-битная компрессия сталкивается с чувствительностью роутера к малейшим искажениям весов. См. llm-quantization.
  • Длинные последовательности и редактирование больших файлов создают для MoE бóльшую нагрузку, чем для плотных моделей: по мере роста контекста маршрутизация экспертов может непредсказуемо смещаться. Это одна из замеченных причин нестабильной работы Qwen в длинных сессиях в local-llm-16gb-vram-tests.

Объём знаний зависит от общего числа параметров, а не от активных

Статья Боцзе Ли (Bojie Li) по IKP (апрель 2026 года) сопоставляет фактологическую ёмкость с количеством параметров на выборке из 37 MoE-моделей. Общее число параметров предсказывает объём знаний (R² = 0.79), а число активных параметров - нет (R² = 0.51). Фактические знания распределены по весам всех экспертов, а не только тех, к которым направляется каждый отдельный токен. Это подтверждает эмпирическую догадку, у которой раньше не было строгого обоснования: когда вы видите "DeepSeek-V3 - модель на 671B параметров, из которых активны 37B", именно число 671B правильно сравнивать с плотной моделью на 671B для оценки знаний, тогда как 37B - корректная база для оценки вычислительных затрат на инференс.

Следствие: прунинг экспертов методом REAP (reap-expert-pruning) разменивает фактологическую ёмкость на компактность с измеримой скоростью. Удаление 20% экспертов снижает как объём вычислений, так и реальный запас фактов, сохранённых в модели.

Заметные MoE-модели в этой вики

  • Gemma 4 26B-A4B - MoE от Google; неожиданный победитель local-llm-16gb-vram-tests.
  • Qwen 3.6 35B-A3B - поколение рассуждающих моделей от Alibaba.
  • Qwen3-Coder 30B-A3B - специализированный вариант для работы с кодом.
  • Qwen3.8-Flash-Next - 125B параметров всего, 6B активных, плюс отдельная таблица n-граммных эмбеддингов на 51B, которая может находиться в оперативной памяти хоста, так как выборка из неё почти не требует вычислений; qwen3-8-flash-next.
  • DeepSeek V3 / R1 / V4 - линейка, доказавшая экономическую эффективность MoE в больших масштабах; см. deepseek.
  • Kimi K3 2.8T - 896 экспертов на слой, маршрутизация top-16, крупнейшая MoE с открытыми весами на данный момент; см. kimi-k3 об архитектуре и deltafin о стоимости её запуска.
  • OLMoE - полностью открытая MoE от Ai2, опубликованная вместе с данными и кодом обучения, как и плотные модели семейства olmo.

Статистике популярности тоже приходится выбирать одно из двух чисел. В atom-report-open-model-ecosystem MoE-модели группируются по общему числу параметров при сравнении загрузок по весовым категориям.