Kimi K3
- title
- Kimi K3
- type
- summary
- summary
- Себастьян Рашка об открытой модели Moonshot K3 на 2,8T: LatentMoE, KDA, attention residuals и повсеместный NoPE
- tags
- llm, architecture, moe, open-weights, attention
- sources
- kimi-k3-architecture-notes
- created
- 2026-07-29
- updated
- 2026-09-14
- lang
- ru
- translation_of
- kimi-k3
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Moonshot AI выложила веса Kimi K3 2026-07-27. В своей заметке на следующий день Себастьян Рашка смотрит на схему архитектуры, а не на лидерборд, и его вывод полезно сбивает пафос: K3 - это не новая архитектура. Это масштабирование для продакшена модели Kimi Linear, выпущенной Moonshot в 2025 году: с 48B её дорастили до 2,8T. За счёт этого она с большим отрывом стала крупнейшей доступной моделью с открытыми весами, причём почти все её компоненты уже применялись в размере в 60 раз меньше.
Единственный действительно новый компонент
По сравнению с Kimi Linear единственный новый компонент - это LatentMoE, тот же блок, что используется в Nemotron 3 Ultra. Идея заимствована из multi-head latent attention: вместо вычислений на полной ширине большие линейные слои проецируются вниз, в латентное пространство меньшей размерности. Если MLA сжимает проекции KV, то LatentMoE сжимает проекции экспертов. Рашка не стал включать этот блок в свою схему архитектуры, так как диаграмма и без того была перегружена.
Всё остальное - замена компонентов на их более дешёвые версии. Обычный mixture-of-experts превратился в LatentMoE, стандартный attention - в смесь gated multi-head latent attention и kimi-delta-attention. Рашка видит здесь то же направление, в котором движутся Nemotron 3 и DeepSeek V4 (о векторе этой лаборатории см. deepseek): архитектурная работа здесь нацелена в основном на удешевление инференса, а не на то, чтобы сделать модель умнее.
Attention residuals - единственное изменение не ради эффективности
Исключение - механизм attention residuals, также унаследованный из Kimi Linear. Это модификация residual-пути, относящаяся к той же категории, что и mHC (manifold-constrained Hyper-Connections) в DeepSeek V4, но работающая иначе: mHC расширяет residual-путь, тогда как attention residuals соединяют residual-связи между слоями и взвешивают каждое соединение коэффициентом внимания. В результате вклад остаточного сигнала одного слоя в другой обучается, а не остаётся фиксированным.
Утверждения в техническом отчёте скромные и идут с ценником: стабильно более низкий validation loss и чуть более высокое качество на прикладных задачах ценой примерно 4% дополнительных затрат на обучение и 2% - на инференс. Публикация накладных расходов наряду с приростом - редкость, заслуживающая внимания, и это единственный компонент в модели, который обоснован качеством, а не пропускной способностью.
Повсеместный NoPE
В K3 вообще нет слоёв с RoPE. Во всех слоях используется NoPE - отсутствие позиционных эмбеддингов, что опять же унаследовано от Kimi Linear. До этого общепринятой практикой было сохранять RoPE в локальных слоях (sliding-window attention) и применять NoPE только в глобальных. Несколько архитектур уже пробовали полный отказ от RoPE, но Рашка считает K3 первой моделью frontier-уровня с таким подходом.
Рашка не объясняет, почему это работает здесь, но вероятная причина кроется в слоях KDA: слой linear-attention с затухающим рекуррентным состоянием уже содержит позиционную информацию неявно, так как вентили удержания позволяют недавним записям сохраняться лучше, чем старым. В итоге порядок кодируется тем, сколько осталось от каждой записи, а не явным вращением query и key.
Кроме того, в K3 появилась нативная мультимодальность, которой не было в Kimi Linear.
Как модель устроена снаружи
Цифра 2,8T - это общее число параметров, а не активных, а маршрутизация достаточно разреженная, чтобы модель могла запускаться на оборудовании, которое и близко не способно вместить её целиком. Проект deltafin, запускающий K3 на одном Mac с Apple Silicon, приводит конкретную структуру: 93 слоя декодера (69 слоёв KDA и 24 слоя MLA) с маршрутизируемыми экспертами в 92 слоях - по 896 экспертов в каждом, всего 82 432 эксперта, при этом для каждого токена на слой выбирается top-16. Веса в формате MXFP4 занимают около 1,56 ТБ, из которых резидентный остов без экспертов составляет примерно 114 ГБ. Каждый токен обращается примерно к 25,8 ГБ экспертных данных.
Открытые веса и хостинг появились на одной неделе. telnyx добавил K3 в свой API инференса 2026-07-28, заявив контекстное окно в 1M токенов и обработку изображений; Modal запустил управляемые эндпоинты K3 2026-07-27, что и породило историю в rl-finetune-beats-frontier. Модель swe-1-7 от Cognition обучалась методом RL на базе предыдущего поколения того же семейства, K2.7. Именно эта закономерность делает релизы Kimi значимыми далеко за пределами их строчек в бенчмарках: их веса становятся базовыми моделями для других команд.
Две темы в базе относятся к самому релизу, а не к архитектуре. Публикация весов спровоцировала очередной раунд споров о политике вокруг открытых весов, который arguments-against-open-source-ai разбирает спустя несколько дней, используя борьбу вокруг экспортного контроля шифрования как прецедент того, к чему политика сдерживания привела в прошлый раз. А страница llm-cross-entropy-similarity посвящена стилометрическому анализу той же модели: ноутбук открывается с зафиксированной парой K3-к-Fable-5, что ближе всего подводит источник к утверждению о сходстве стиля Moonshot со стилем Anthropic, - это скорее зашитый вид по умолчанию, чем вывод, который автор где-либо аргументирует.
Значение релиза за пределами архитектуры разбирается в разделе базы, посвящённом открытым моделям. Нейтан Ламберт в kimi-k3-open-weights-escalation называет K3 первой открытой моделью frontier-уровня и оценивает разрыв между открытыми и закрытыми моделями после неё в три-пять месяцев вместо прежних шести-девяти; K3 лидирует среди открытых моделей во всех трёх замерах, собранных в open-closed-model-gap. Релиз состоялся через пятнадцать дней после того, как в six-months-to-live-for-open-models он предсказал, что появление открытой модели такого уровня спровоцирует запрет или задержку открытых frontier-весов в США. В контексте дистилляции модель упоминается дважды: в отчёте Anthropic anthropic-threat-report-september-2026 Moonshot названа среди семи китайских лабораторий, которые, по утверждению компании, дистиллировали Claude, а в приложении к stealing-reasoning-traces-from-proprietary-llm-apis отмечается, что K3 необычно сильно реагирует на цепочки рассуждений Anthropic, хотя авторы подчёркивают, что это не доказательство.
Заметка Рашки посвящена только архитектуре. Он упоминает, что в техническом отчёте есть "ещё несколько любопытных деталей обучения", до которых у него не дошли руки.
- Nathan Lambert on China's AI Ecosystem and the Open Model Gap
- deltafin
- Detecting and countering misuse of AI: September 2026
- Are Open Models Catching Up?
- The Arguments Against Open Source AI are Very Bad
- The ATOM Report: Measuring the Open Language Model Ecosystem
- DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, 10 points above previous DeepSeek V4 Flash
- DeepSeek
- GLM-5.3: How Chinese labs keep stride with the frontier
- How distillation is used today and what performance uplift it gives to open models
- LLMs: Intelligence vs. Cost
- Kimi Delta Attention (KDA)
- Kimi K3: The open-weights escalation
- Which LLMs Write Alike
- Mixture of Experts (MoE)
- Neutrino-1 8B
- Open-closed model gap
- Reasoning Prefills on Open Models, v1.1
- Qwen4: The Architecture of the Future (Qwen3.8-Flash-Next)
- A $500 RL Fine-Tune That Beat the Frontier
- 6 months to live for open models
- Stealing Reasoning Traces from Proprietary LLM APIs
- SWE-1.7 — Cognition's Coding Model
- Telnyx Inference