EnglishРусский Map

Разрыв между открытыми и закрытыми моделями

title
Разрыв между открытыми и закрытыми моделями
type
concept
summary
Насколько лучшие открытые LLM отстают от закрытых: методики оценки, разброс от 4 до 10 месяцев и шансы сократить отставание.
tags
ai, open-weights, benchmarks, llm, china
created
2026-09-14
updated
2026-09-14
lang
ru
translation_of
open-closed-model-gap
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Разрыв между открытыми и закрытыми моделями - это дистанция между лучшей LLM, чьи веса может скачать любой желающий, и лучшей моделью, доступной только через API. Обычно его выражают как временное отставание ("открытые модели отстают на N месяцев"), а иногда в баллах бенчмарк-индекса. В сентябре 2026 года в open-source-ai-reading-list Нейтан Ламберт (Nathan Lambert) привёл консенсусную оценку: "примерно 4-6 месяцев", отметил, что в последние годы разрыв сократился, а все передовые открытые модели примерно с 2024 года выпускают китайские лаборатории. Первоисточники, стоящие за этим утверждением, расходятся между собой. В зависимости от выбранных бенчмарков оценки варьируются от четырёх до десяти месяцев, причём один анализ указывает на расширение разрыва, а другой - на то, что с каждой новой эпохой он закрывается всё быстрее.

Как его измеряют

Простейший способ - композитный индекс. Artificial Analysis прогоняет каждую модель через фиксированный набор тестов (девять оценок в Index v4.1, включая GDPval-AA, Terminal-Bench, Humanity's Last Exam и GPQA Diamond) и публикует ступенчатый график с динамикой лучших баллов моделей с открытыми весами и проприетарных моделей. Epoch AI делает то же самое в своём Epoch Capabilities Index, который можно построить по дате релиза и отфильтровать по доступности. Индекс показывает разрыв в баллах. На 31 июля 2026 года в Artificial Analysis у Claude Opus 5 (max) был 61 балл, а у лучшей открытой модели, kimi-k3 (max), - 57 (deepseek-v4-flash-0731-artificial-analysis). Эмпирическое правило Гвидо Империале (Guido Imperiale) для этого индекса: разницу в один балл никто не заметит, а пять баллов - это уже ощутимо (intelligence-vs-cost-linear).

Баллы напрямую не переводятся в месяцы, поэтому чаще цитируют оценки, полученные сопоставлением уровней. Ховард Твейт Иле (Håvard Tveit Ihle, how-far-behind-are-open-models) задаёт пороговые значения баллов для каждого из 17 бенчмарков и замеряет, через сколько времени после первой закрытой модели этот порог впервые преодолевает открытая. SemiAnalysis (are-open-models-catching-up) делит историю LLM на три эпохи, по четыре бенчмарка в каждой, и засекает время: сколько продержался закрытый флагман, открывший эпоху, прежде чем открытая модель обошла его.

На результат влияют два методических выбора. Первый - какую границу интервала брать за точку отсчёта. Иле привязывает каждый разрыв к дате релиза открытой модели, получая ретроспективную оценку: насколько далеко назад нужно отмотать время, чтобы найти закрытые модели уровня сегодняшних открытых. На вопрос, устремлённый вперёд (сколько времени пройдёт, пока открытые модели догонят сегодняшний закрытый фронтир), можно ответить только задним числом. Таймер эпохи у SemiAnalysis запускается в момент выхода закрытой модели и отслеживает только первый закрытый флагман этой эпохи, игнорируя то, что закрытый фронтир продолжал уходить вперёд.

Второй фактор: все эти методики учитывают даты релизов. Внутренние модели лабораторий опережают публичные, и эта задержка везде разная. SemiAnalysis оценивает задержку между обучением и релизом у GPT-4 в 218 дней, а у Mythos - в 114 (are-open-models-catching-up). Продуктовый лидер Z.ai в ноябре 2025 года заявил, что модели GLM выкладывают в открытый доступ "в течение нескольких часов" после завершения обучения (zai-playbook). Таким образом, разрыв по датам релизов отражает лишь то, что доступно публике, и занижает реальное опережение внутренних моделей американских лабораторий. О том же говорит и Ламберт в glm-5-3-how-chinese-labs-keep-stride.

Оценки в динамике

Когда Кто Метод Оценка
Ноя 2025 Нейтан Ламберт, выступление на The Curve (lambert-china-ai-ecosystem-open-model-gap) Экспертная оценка, графики Epoch AI Открытые модели отстают от фронтира на "месяцы", американские открытые модели - на годы; он называет это отставание полезным буфером безопасности
Фев 2026 Ламберт, open-models-in-perpetual-catch-up Индекс Artificial Analysis Около 6 месяцев, отставание "держится стабильно"; вероятный сценарий на будущее - лаг в 6-9 месяцев
Май 2026 Иле, how-far-behind-are-open-models Преодоление порогов, 17 бенчмарков 8-10 месяцев на закрытых бенчмарках, 4-6 на публичных; минимальный разрыв во времена R1 (январь 2025 года), затем рост
Июл 2026 Artificial Analysis, deepseek-v4-flash-0731-artificial-analysis Intelligence Index v4.1 4 балла: Claude Opus 5 набрал 61, Kimi K3 - 57
Авг 2026 SemiAnalysis, are-open-models-catching-up Композиты по эпохам, собственные тесты Время догона: 19.7, 8.5, затем 4.8 месяца на эпоху; GPT-5.6 набрал 99.1 против 93.0 у Kimi K3 на агентском композите
Сен 2026 Ламберт, open-source-ai-reading-list Обобщение приведённых данных Примерно 4-6 месяцев, сократился в последние годы

В февральском посте Ламберта приведены две цифры для одного и того же: "~6-месячный разрыв держится стабильно" в начале и "отстают от лучших закрытых моделей на 6-9 месяцев" ниже по тексту. В таблице сохранены обе.

В чём они расходятся

В абсолютных цифрах оценки сходятся ближе, чем кажется на первый взгляд. 4.8 месяца от SemiAnalysis получены на четырёх свежих публичных бенчмарках и укладываются в диапазон 4-6 месяцев, выведенный Иле для открытых тестов. Оценка в 6 месяцев от Ламберта взята из индекса, построенного на публичных бенчмарках. Число 4-6 месяцев из списка литературы - это как раз показатель по публичным тестам.

Результаты Иле на закрытых (private) бенчмарках резко выбиваются из общего ряда: 8-10 месяцев, то есть почти вдвое больше. Он объясняет это тем, что создатели открытых моделей менее тщательно фильтруют данные для обучения и сильнее подгоняют модели под тесты. Это согласуется с февральским тезисом Ламберта о том, что индекс Artificial Analysis "не совсем точно отражает реальный фронтир", и с его замечанием в how-much-does-distillation-matter-for-chinese-llms: китайские лаборатории подходят к бенчмаркам так, что "со стороны кажется, будто они чуть ближе, чем на самом деле". SemiAnalysis фактически признаёт этот факт: Kimi K3 обходит Fable 5 на их композитном тесте, но для собственных рабочих задач компания всё равно использует Fable. Практики вне дискуссий о бенчмарках говорят то же самое о длинных задачах без контроля человека (local-ai-is-not-opus).

Впрочем, не все искажения играют в пользу открытых моделей. Иле указывает на несколько факторов, искусственно увеличивающих измеряемый разрыв: эффект "проклятия победителя" из-за того, что на бенчмарках тестируется больше закрытых моделей, ошибки у сторонних провайдеров хостинга открытых моделей, а также утечки тестовых данных со стороны закрытых разработчиков в FrontierMath (OpenAI финансировала его и видела большинство задач) и ARC-AGI (его частично закрытый набор задач проходит через коммерческие API).

Что касается динамики разрыва, тут мнения расходятся. SemiAnalysis считает, что время догона с каждой эпохой сокращается вдвое. Иле видит наименьший разрыв в январе 2025 года и его последующее расширение как на публичных, так и на закрытых бенчмарках. Ламберт считал, что он держится на одном уровне. Частично это объясняется методологией. У SemiAnalysis есть только по одной точке на эпоху, их таймер запускается до того, как открытые модели входят в новую эпоху, а открытые модели подключаются к каждой новой эпохе всё быстрее - это сокращает замеряемое время, но ничего не говорит о текущей дистанции. Кривые Иле аппроксимируют множество точек, но зависят от критериев зачёта/незачёта ответов, которые в основном выставлялись с помощью Claude Opus 4.7 и корректировались вручную. Ни один из анализов не может окончательно опровергнуть другой. Утверждение из списка литературы о том, что разрыв "сократился в последние годы", верно по данным SemiAnalysis, но по данным Иле это справедливо, только если под "последними годами" понимать период начиная с 2023-го.

Фронтир стоимости и фронтир производительности

Модель может уступать по интеллекту, но оставаться самой выгодной покупкой. График соотношения интеллекта и стоимости от Artificial Analysis проводит линию Парето через самую дешёвую модель для каждого уровня баллов. В конце июля 2026 года на этой линии находились две открытые модели: DeepSeek V4 Flash 0731 (набирает 50 баллов, обходясь примерно на 60% дешевле за задачу, чем GPT-5.6 Luna с 51 баллом) и Kimi K3 ближе к вершине. На самом производительном конце линии открытых моделей не было - там находился Claude Opus 5 (deepseek-v4-flash-0731-artificial-analysis). Империале развивает эту мысль в intelligence-vs-cost-linear: GLM-5.3 набирает 60 баллов при стоимости $0.49 за задачу против 66 баллов у Fable 5.1 за $3.69, и он сомневается, что большинство пользователей вообще заметит разницу.

Какой фронтир важнее, зависит от покупателя. В open-and-closed-models-are-on-different-exponentials Ламберт утверждает: пользователи сред разработки с агентами доказали, что готовы переплачивать огромную наценку за лучшую модель, поскольку с ней их отдача заметно выше; корпоративный же сектор внедряет открытые модели, как только они перешагивают порог применимости для конкретной задачи, и после этого редко их меняет. С этой точки зрения разрыв по возможностям определяет цену топовых закрытых моделей, а разрыв по стоимости решает судьбу внедрения во всех остальных сферах. SemiAnalysis формулирует этот же вопрос через опасение: если открытые модели приблизятся к фронтиру вплотную, слой самих моделей превратится в коммодити (are-open-models-catching-up). Сноска в arguments-against-open-source-ai критикует обратную сторону этого утверждения - тезис о том, что рынки за пределами фронтира - это "просто фронтир минус N месяцев", и поэтому они неизбежно достанутся тому, кто удерживает фронтир.

Почему лидирующие открытые модели - китайские

До 2024 года открытый фронтир удерживала главным образом Llama от Meta. Графики SemiAnalysis показывают, что Llama-2 открыла первую эпоху, а Llama-3.1-405B обошла GPT-3.5 Turbo в июле 2024 года. Затем Llama-4 Maverick в 2025 году "погасила" набранный DeepSeek R1 импульс; Ламберт на The Curve отметил, что если бы Llama 4 оказалась удачнее, обсуждение разрыва тем летом пошло бы совсем в другом ключе. Начиная с июля 2024 года отдельный анализ Иле только по китайским моделям даёт практически те же кривые, что и общий анализ, за редкими исключениями. С этого момента именно китайская модель почти всегда первой среди открытых преодолевала очередной порог. В августе 2026 года на агентском композите SemiAnalysis лучшие американские открытые модели - Inkling (51.1) и Nemotron 3 Ultra (32.7) - безнадёжно отставали от Kimi K3 (93.0).

Объяснения Ламберта в glm-5-3-how-chinese-labs-keep-stride в основном организационные. Z.ai выпускает модели за считанные дни: те месяцы, которые американские лаборатории тратят на предрелизное тестирование, Z.ai использует для штурма бенчмарков. Финансирование компании сильнее зависит от баллов в публичных тестах, чем у OpenAI или Anthropic. Её флагман более специализирован (только текст с упором на агентское программирование), что упрощает post-training. В Китае растёт рынок данных для RL, значительную часть которых продают американские компании, поэтому китайские лаборатории могут закупать те же среды, что и фронтирные игроки. Кроме того, у них сильная команда, связанная с университетом Цинхуа и, вероятно, более эффективно использующая вычислительные ресурсы, чем американские лаборатории. В open-models-in-perpetual-catch-up добавляется, что китайские лаборатории открыто заимствуют опубликованные идеи друг друга в гораздо большей степени, чем это принято в Кремниевой долине. О структурных и исторических предпосылках см. chinas-structural-advantage-in-open-source-ai и notes-from-inside-chinas-ai-labs.

Политическое объяснение сводится к llm-distillation: китайские лаборатории держатся близко только потому, что обучаются на ответах американских моделей. Ламберт признаёт, что дистилляция имеет место (включая злоупотребление API для извлечения цепочек рассуждений), и что больше всего она помогает при выходе лаборатории в новую предметную область. Но он доказывает, что это не главный фактор, и его значимость снижается по мере того, как RL захватывает post-training, ведь для RL требуются генерации по собственной политике (on-policy) из собственной модели. Он также считает, что Fable 5 вышла слишком поздно, чтобы стать учителем для Kimi K3 или GLM-5.2 (how-distillation-is-used-today, the-distillation-panic). SemiAnalysis относится к этому фактору серьёзнее и включает дистилляцию в число причин, почему "ничто не остаётся тайной навсегда". Кевин Сюй (Kevin Xu), чья цитата приводится в the-distillation-panic, разворачивает аргумент в другую сторону: лаборатории, полагающиеся на дистилляцию для сокращения дистанции, могут так никогда и не научиться быть лидерами, поэтому изоляция в долгосрочной перспективе может пойти им на пользу.

Сокращается ли разрыв?

В источниках прослеживаются три позиции.

Позиция о сокращении разрыва принадлежит SemiAnalysis: лидерство в каждой эпохе длится примерно вдвое меньше предыдущего, лаборатории фронтира теперь выпускают релизы каждые 51 день, не успевая сформировать устойчивый отрыв, а исследовательские прорывы утекают или подвергаются обратному инжинирингу.

Позиция о стабильном разрыве - концепция "вечного догона" Ламберта. У американских лабораторий несравнимо больше вычислительных мощностей, данных и пользователей, но в режиме логарифмически-линейного скейлинга эти преимущества дают лишь скромный перевес, из-за чего открытые модели держатся ближе, чем ожидалось. Однако закрытые модели постоянно осваивают новые, более ценные задачи, поэтому открытые продолжают отставать. По его мнению, открытые модели победят лишь в случае фундаментальных сдвигов - например, появления способа объединять экспертные модели и делиться ими или стократного удешевления обучения (open-models-in-perpetual-catch-up).

Позиция о расширении разрыва состоит из двух частей. Первая - измерительная: кривые Иле идут вверх начиная с января 2025 года. Вторая - стратегическая. Ламберт ожидает, что закрытые лаборатории перестанут выводить свои лучшие модели в API, чтобы защитить объём токенов, избежать дистилляции и сохранить за собой высокомаржинальные сценарии. Это приведёт к росту разрыва по датам релизов, даже если внутренний уровень возможностей не изменится (open-and-closed-models-are-on-different-exponentials). На The Curve он сформулировал открытый вопрос так: скажется ли американское преимущество по вычислительным мощностям прямо сейчас с реальным восстановлением разрыва, или китайские лаборатории удержатся на хвосте (lambert-china-ai-ecosystem-open-model-gap). Он ожидает, что авторы открытых моделей со временем бросят погоню за Claude и GPT в индексе Artificial Analysis и займутся своими нишами. Если это произойдёт, разрыв по индексам перестанет отражать то, что разработчики открытых моделей вообще пытаются сократить.

Но один фактор может сработать и в обратную сторону. Если циклы самообучения в лабораториях станут зависеть от пользовательских данных, лаборатория, выпускающая релизы за несколько часов, начнёт собирать эти данные на месяцы раньше той, которая тестирует модели месяцами, что сыграет на руку китайским лабораториям (glm-5-3-how-chinese-labs-keep-stride).