Kimi K3: эскалация открытых весов
- title
- Kimi K3: эскалация открытых весов
- type
- summary
- summary
- Нейтан Ламберт о Kimi K3 как первой по-настоящему передовой модели с открытыми весами, китайских лабораториях и вреде запрета открытых весов
- tags
- ai, open-weights, china, policy, llm, ai-lab
- created
- 2026-09-14
- updated
- 2026-09-14
- lang
- ru
- translation_of
- kimi-k3-open-weights-escalation
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Нейтан Ламберт (Nathan Lambert) написал этот текст для interconnects 2026-07-20, спустя четыре дня после анонса kimi-k3 компанией Moonshot AI и за неделю до обещанного релиза весов 27 июля. Эссе написано в предположении, что Moonshot сдержит обещание по дате, что компания и сделала. Ламберт прямо говорит об этом в начале: если бы K3 осталась закрытой, большинство его выводов смягчились бы до компромиссного варианта, при котором у Китая есть передовые модели, но он не раздаёт их бесплатно.
Его главный тезис касается разрыва. Как ни измеряй - открытые против закрытых или китайские против американских - отставание оценивали в 6-9 месяцев, а K3 сокращает его примерно до 3-5. Он называет K3 максимальным приближением открытых моделей к переднему краю со времён DeepSeek R1, но событием другого порядка. R1 была быстрым разворотом в сторону reasoning-моделей. K3 - это китайская лаборатория, выполняющая привычную работу по масштабированию данных, алгоритмов, архитектуры, инструментов и сред, получая при этом результат передового уровня. Цифры, которые он приводит: 2-е место в индексе Vals AI, 3-е место в Artificial Analysis Intelligence Index позади Claude Fable и GPT-5.6 Sol Max при меньшей стоимости и 1-е место в Frontend Code Arena. В его рейтинге лабораторий по лучшей модели на тот момент Anthropic, OpenAI и Moonshot занимают места с первого по третье, а следом идут SpaceXAI, Zhipu (z-ai), Meta, DeepMind и Alibaba.
Архитектурный разбор этой же модели от Рашки (Raschka) находится на странице kimi-k3. На этой странице рассматривается то, как значение этого релиза оценивает Ламберт.
Не история про дистилляцию
Ламберт считает K3 концом спора о том, что китайские модели хороши лишь потому, что копируют американские. Если состязательная дистилляция из передовых моделей США и внесла свой вклад, отмечает он, то лишь незначительный, и любого, кто вслед за the-distillation-panic пришёл к выводу, что китайские лаборатории держатся на краже интеллектуальной собственности, "ждёт отрезвление". Этот аргумент строится на качестве полученного результата, а не на доказательствах о данных обучения, и он в любом случае ожидает продолжения давления вокруг дистилляции. Более подробный разбор этой темы дан в how-much-does-distillation-matter-for-chinese-llms.
Вместо этого он предлагает организационное объяснение. Побывав в Moonshot во время поездки, описанной в notes-from-inside-chinas-ai-labs, он описывает культуру команды, которую почувствовал сразу, что, по его словам, бывает редко. Есть и фактор вычислительных мощностей. У китайских лабораторий вычислительных ресурсов куда меньше, чем у американских, но до недавнего времени у них был и заметно меньший спрос на инференс, поэтому большая часть уходила на обучение. Когда Ламберт пошутил, что у рядового исследователя в OpenAI может быть пара тысяч эквивалентов H100, исследователи Kimi были шокированы. Этот баланс уже начал меняться: Moonshot пришлось приостановить оформление новых подписок на K3, сохранив при этом доступность API.
Аргумент об эффективности капитала идёт ещё дальше. Китайские лаборатории привлекли на порядки меньше денег, чем любой сегмент американской индустрии, однако единственные общедоступные модели, явно опережающие K3, созданы OpenAI и Anthropic, тогда как Google и Meta с крупнейшими денежными потоками в истории бизнеса остаются позади. Модель Inkling от Thinking Machines сильна, но "находится в другом классе". Ламберт предполагает, что часть эффективности обусловлена стратегией. Догонять дешевле, чем изобретать следующий шаг, подобно тому как модель-ученик при дистилляции может в итоге превзойти своего учителя. Он также упоминает растущую китайскую индустрию данных и вычислительные мощности для обучения, полученные в обход экспортного контроля, признавая, что точных оценок ни для того, ни для другого практически нет.
Почему Китай остаётся открытым
Ламберт утверждает, что китайские лаборатории начали открывать веса не в рамках грандиозной стратегии. Большинство из них хотят того же, чего хотят Anthropic и OpenAI: создать наилучшую модель из возможных. Открытые веса были практичным способом добиться внедрения, внимания и обратной связи, прежде всего на рынке Кремниевой долины (Bay Area). В zai-playbook руководитель продукта Z.ai говорит то же самое о своей компании.
На той же неделе изменилась государственная политика. В программной речи Си Цзиньпина на World AI Conference будущее китайского ИИ было закреплено за open source и глобальным распространением - впервые высшее руководство заявило об этом публично. Ламберт трактует выбор момента как заявление о допустимом уровне риска. Простейшее объяснение, на его взгляд, состоит в том, что китайское правительство отслеживает риски моделей с большей технической глубиной, чем американское "регулирование по наитию" ("vibe regulation"), и на данный момент не видит существенных угроз в передовых моделях. Тем временем экономические плановики нацелены сначала на распространение, а прибыль оставляют на потом - именно такой подход Китай применял в автомобилестроении и солнечной энергетике. Для американской аудитории, которую месяцами пугали Claude Mythos, это, по его мнению, должно послужить полезным напоминанием: остальной мир не разделяет подобных страхов.
Деселерационизм для лабораторий, акселерационизм для всех остальных
Самая цитируемая часть эссе - это ответ Дину Боллу (Dean Ball), который сейчас работает в OpenAI и лично поддерживает открытые модели. Болл написал, что модели с открытыми весами "по своей природе деселерационны". Ламберт соглашается с этим в определённом смысле. Сильные открытые модели снижают маржинальность, на которую могут рассчитывать закрытые лаборатории, что оставляет им меньше прибыли для реинвестирования и снижает финальную оценку компании (terminal value) инвесторами, а оба этих фактора замедляют капитальные затраты (capex). При этом он не считает, что этот эффект достаточно силён, чтобы помешать OpenAI и Anthropic войти в число самых дорогих компаний мира.
Те же модели ускоряют проникновение ИИ в экономику, поскольку они снижают порог входа для заданного уровня возможностей и позволяют бизнесу адаптировать решения под себя. Это распространение идёт медленно. Формулировка Ламберта из open-and-closed-models-are-on-different-exponentials сводится к тому, что открытые модели развиваются по экспоненте, которая медленнее стартует, но потенциально может оказаться масштабнее. Подвох в том, что адаптация перестанет иметь значение, если закрытые модели уйдут слишком далеко вперёд. Он считает, что замедление передовых лабораторий в сочетании с более широким распространением технологий полезно для перехода в целом, так как это даёт запас по времени и распределяет влияние за пределы какой-либо одной компании, хотя сам он по-прежнему хочет, чтобы лучшие модели оставались американскими. В arguments-against-open-source-ai приводятся цитаты Болла с другой стороны этой дискуссии - о том, что открытые веса ведут к "ИИ-коммунизму".
Архитектурное отступление
Блог Moonshot объясняет примерно 2,5-кратный прирост эффективности масштабирования по сравнению с Kimi K2 использованием kimi-delta-attention, attention residuals, более разреженной архитектуры mixture-of-experts с 16 активными экспертами из 896 в рамках фреймворка "Stable LatentMoE", а также улучшенными рецептами обучения и подготовки данных. На примере KDA Ламберт прослеживает, как быстро академические идеи теперь доходят до production. Gated Delta Networks появились в конце 2024 года как развитие Mamba. KDA выросла из статьи по Kimi Linear и напоминает Gated DeltaNet в Olmo Hybrid - последней модели Ламберта в Ai2, а к середине 2026 года эта идея уже оказалась в передовых моделях. В те же выходные Alibaba анонсировала модель Qwen 3.8 на 2,4 триллиона параметров с открытыми весами, хотя исторически держала свои самые крупные модели доступными только через API. Вскоре после этого ожидался выход DeepSeek V4 из стадии preview.
Риски и реакция регуляторов
Позиция Ламберта в отношении рисков двойственна. Он считает, что если бы Claude Mythos выпустили с открытыми весами сегодня, ущерб был бы относительно небольшим, и утверждает, что риски были чрезмерно раздуты, хотя и признаёт скудность публичных оценок в сфере кибербезопасности. Он не ожидает, что это утверждение останется в силе для куда более мощных моделей, и называет текущее положение дел, при котором лучшие модели доступны только через контролируемый закрытый доступ за несколько месяцев до появления сопоставимых открытых, "невероятно безопасным равновесием". Отставание выступает буфером. Запрет открытых весов не устранил бы его и не остановил бы их появление, поскольку "нельзя эффективно запретить цифровые продукты, особенно злоумышленникам".
Затем он цитирует репортаж Axios о мерах, рассматривавшихся правительством США: включение китайских ИИ-лабораторий в Entity List Министерства торговли, рекомендации АНБ (NSA) и Офиса национального кибердиректора (Office of the National Cyber Director), отговаривающие компании от использования китайских моделей, президентский указ, разрешающий американским компаниям хостить китайские модели только при гарантии безопасности и принятии ответственности за утечки, а также проект правил Минторга по цепочкам поставок, направленный против китайских моделей с открытым исходным кодом. Его возражение строится на асимметрии: американские модели будут скованы защитными барьерами кибербезопасности, в то время как злоумышленники из других стран смогут проверять защиту США с помощью мощных китайских открытых весов. six-months-to-live-for-open-models развивает регуляторный аргумент, а us-scrutiny-of-chinese-model-use собирает действия Конгресса за месяцы вокруг публикации этого эссе.
Его предложение - создание независимой от финансово заинтересованных компаний инфраструктуры тестирования и оценки, быстро развёрнутой по модели операции Warp Speed, чтобы государство и другие независимые участники могли оценивать модели и изучать возникающие риски. Чрезмерно жёсткое регулирование, по его мнению, лишь убедит людей в том, что больше ничего делать не нужно, и только отсрочит момент, когда открытые модели преодолеют очередной порог возможностей. Его заключительный вывод носит исторический характер: 2025 год стал моментом, когда открытые модели начали воспринимать всерьёз, а в 2026 году передовые открытые веса со всеми их рисками и преимуществами появились на самом деле.
Место среди более поздних источников
Разрыв в 3-5 месяцев - это июльская оценка Ламберта, и она меньше его собственных цифр в других работах. Месяцем ранее в glm-5-2-step-change-for-open-agents он оценивал разрыв между Claude Opus 4.5 и GLM-5.2 в 6,8 месяца. В списке для чтения, опубликованном им в сентябре, этот разрыв составляет примерно от 4 до 6 месяцев (open-closed-model-gap). Оценки близки, но сильно зависят от того, какая пара моделей сравнивается. Менее чем через четыре недели после этого эссе в glm-5-3-how-chinese-labs-keep-stride аналогичный аргумент был распространён на модель, которая по размеру составляет треть от K3.
- Nathan Lambert on China's AI Ecosystem and the Open Model Gap
- GLM-5.2 is the step change for open agents
- GLM-5.3: How Chinese labs keep stride with the frontier
- Interconnects (interconnects.ai)
- Kimi K3
- Open-Source AI & Open Models Reading List
- 6 months to live for open models
- US Scrutiny of Chinese Model Use
- Z.ai (Zhipu AI)