EnglishРусский Map

Kimi K3

title
Kimi K3
type
summary
summary
Себастьян Рашка об открытой модели Moonshot K3 на 2,8T: LatentMoE, KDA, attention residuals и повсеместный NoPE
tags
llm, architecture, moe, open-weights, attention
created
2026-07-29
updated
2026-09-14
lang
ru
translation_of
kimi-k3
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Moonshot AI выложила веса Kimi K3 2026-07-27. В своей заметке на следующий день Себастьян Рашка смотрит на схему архитектуры, а не на лидерборд, и его вывод полезно сбивает пафос: K3 - это не новая архитектура. Это масштабирование для продакшена модели Kimi Linear, выпущенной Moonshot в 2025 году: с 48B её дорастили до 2,8T. За счёт этого она с большим отрывом стала крупнейшей доступной моделью с открытыми весами, причём почти все её компоненты уже применялись в размере в 60 раз меньше.

Единственный действительно новый компонент

По сравнению с Kimi Linear единственный новый компонент - это LatentMoE, тот же блок, что используется в Nemotron 3 Ultra. Идея заимствована из multi-head latent attention: вместо вычислений на полной ширине большие линейные слои проецируются вниз, в латентное пространство меньшей размерности. Если MLA сжимает проекции KV, то LatentMoE сжимает проекции экспертов. Рашка не стал включать этот блок в свою схему архитектуры, так как диаграмма и без того была перегружена.

Всё остальное - замена компонентов на их более дешёвые версии. Обычный mixture-of-experts превратился в LatentMoE, стандартный attention - в смесь gated multi-head latent attention и kimi-delta-attention. Рашка видит здесь то же направление, в котором движутся Nemotron 3 и DeepSeek V4 (о векторе этой лаборатории см. deepseek): архитектурная работа здесь нацелена в основном на удешевление инференса, а не на то, чтобы сделать модель умнее.

Attention residuals - единственное изменение не ради эффективности

Исключение - механизм attention residuals, также унаследованный из Kimi Linear. Это модификация residual-пути, относящаяся к той же категории, что и mHC (manifold-constrained Hyper-Connections) в DeepSeek V4, но работающая иначе: mHC расширяет residual-путь, тогда как attention residuals соединяют residual-связи между слоями и взвешивают каждое соединение коэффициентом внимания. В результате вклад остаточного сигнала одного слоя в другой обучается, а не остаётся фиксированным.

Утверждения в техническом отчёте скромные и идут с ценником: стабильно более низкий validation loss и чуть более высокое качество на прикладных задачах ценой примерно 4% дополнительных затрат на обучение и 2% - на инференс. Публикация накладных расходов наряду с приростом - редкость, заслуживающая внимания, и это единственный компонент в модели, который обоснован качеством, а не пропускной способностью.

Повсеместный NoPE

В K3 вообще нет слоёв с RoPE. Во всех слоях используется NoPE - отсутствие позиционных эмбеддингов, что опять же унаследовано от Kimi Linear. До этого общепринятой практикой было сохранять RoPE в локальных слоях (sliding-window attention) и применять NoPE только в глобальных. Несколько архитектур уже пробовали полный отказ от RoPE, но Рашка считает K3 первой моделью frontier-уровня с таким подходом.

Рашка не объясняет, почему это работает здесь, но вероятная причина кроется в слоях KDA: слой linear-attention с затухающим рекуррентным состоянием уже содержит позиционную информацию неявно, так как вентили удержания позволяют недавним записям сохраняться лучше, чем старым. В итоге порядок кодируется тем, сколько осталось от каждой записи, а не явным вращением query и key.

Кроме того, в K3 появилась нативная мультимодальность, которой не было в Kimi Linear.

Как модель устроена снаружи

Цифра 2,8T - это общее число параметров, а не активных, а маршрутизация достаточно разреженная, чтобы модель могла запускаться на оборудовании, которое и близко не способно вместить её целиком. Проект deltafin, запускающий K3 на одном Mac с Apple Silicon, приводит конкретную структуру: 93 слоя декодера (69 слоёв KDA и 24 слоя MLA) с маршрутизируемыми экспертами в 92 слоях - по 896 экспертов в каждом, всего 82 432 эксперта, при этом для каждого токена на слой выбирается top-16. Веса в формате MXFP4 занимают около 1,56 ТБ, из которых резидентный остов без экспертов составляет примерно 114 ГБ. Каждый токен обращается примерно к 25,8 ГБ экспертных данных.

Открытые веса и хостинг появились на одной неделе. telnyx добавил K3 в свой API инференса 2026-07-28, заявив контекстное окно в 1M токенов и обработку изображений; Modal запустил управляемые эндпоинты K3 2026-07-27, что и породило историю в rl-finetune-beats-frontier. Модель swe-1-7 от Cognition обучалась методом RL на базе предыдущего поколения того же семейства, K2.7. Именно эта закономерность делает релизы Kimi значимыми далеко за пределами их строчек в бенчмарках: их веса становятся базовыми моделями для других команд.

Две темы в базе относятся к самому релизу, а не к архитектуре. Публикация весов спровоцировала очередной раунд споров о политике вокруг открытых весов, который arguments-against-open-source-ai разбирает спустя несколько дней, используя борьбу вокруг экспортного контроля шифрования как прецедент того, к чему политика сдерживания привела в прошлый раз. А страница llm-cross-entropy-similarity посвящена стилометрическому анализу той же модели: ноутбук открывается с зафиксированной парой K3-к-Fable-5, что ближе всего подводит источник к утверждению о сходстве стиля Moonshot со стилем Anthropic, - это скорее зашитый вид по умолчанию, чем вывод, который автор где-либо аргументирует.

Значение релиза за пределами архитектуры разбирается в разделе базы, посвящённом открытым моделям. Нейтан Ламберт в kimi-k3-open-weights-escalation называет K3 первой открытой моделью frontier-уровня и оценивает разрыв между открытыми и закрытыми моделями после неё в три-пять месяцев вместо прежних шести-девяти; K3 лидирует среди открытых моделей во всех трёх замерах, собранных в open-closed-model-gap. Релиз состоялся через пятнадцать дней после того, как в six-months-to-live-for-open-models он предсказал, что появление открытой модели такого уровня спровоцирует запрет или задержку открытых frontier-весов в США. В контексте дистилляции модель упоминается дважды: в отчёте Anthropic anthropic-threat-report-september-2026 Moonshot названа среди семи китайских лабораторий, которые, по утверждению компании, дистиллировали Claude, а в приложении к stealing-reasoning-traces-from-proprietary-llm-apis отмечается, что K3 необычно сильно реагирует на цепочки рассуждений Anthropic, хотя авторы подчёркивают, что это не доказательство.

Заметка Рашки посвящена только архитектуре. Он упоминает, что в техническом отчёте есть "ещё несколько любопытных деталей обучения", до которых у него не дошли руки.