EnglishРусский Map
Open-Source AI & Open Models Reading List

Отчёт ATOM: измерение экосистемы открытых языковых моделей

title
Отчёт ATOM: измерение экосистемы открытых языковых моделей
type
summary
summary
Исследование внедрения ~1,5 тыс. открытых моделей (2026): Китай обогнал США по скачиваниям, доминирует Qwen, предложена метрика нормализации по размеру
tags
ai, open-weights, llm, china, research, ai-lab
created
2026-09-14
updated
2026-09-14
lang
ru
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Отчёт ATOM - это препринт на arXiv за апрель 2026 года (2604.07190), написанный Нейтаном Ламбертом (Nathan Lambert) и Флорианом Брандом (Florian Brand) из Interconnects AI. Это эмпирическая половина работы atom-project-american-truly-open-models: методики, которые изначально использовались для обоснования этого проекта, авторы развернули в полноценное исследование. В отчёте прямо подчёркивается, что он не содержит политических рекомендаций, а за ними авторы отсылают к эссе по проекту ATOM. В списке open-source-ai-reading-list Ламберт помечает эту работу как необязательную и описывает её как общую сводку по распространению моделей США и Китая.

Предмет исследования уже, чем понятие "AI с открытым исходным кодом" в целом. Авторы отслеживают около 1,5 тысяч основных открытых языковых моделей, вышедших со времён появления ChatGPT - то есть моделей, принимающих текст на вход и возвращающих текст на выход. Эмбеддинговые модели, диффузионные модели для генерации изображений и небольшие классификаторы исключены: они могут завышать показатели скачиваний и дообучений, почти не влияя на развитие технологии.

Как устроены измерения

Основной сигнал - количество скачиваний на Hugging Face. Скачиванием считается любой HTTP-запрос к файлу модели, включая программные загрузки. Исторические помесячные данные с ноября 2023 по 10 июля 2025 года для шести организаций (Meta, Qwen, Mistral, DeepSeek, Google, Microsoft) предоставил сам Hugging Face, отфильтровав всплески по правилу 2,5 межквартильного размаха. С июля 2025 года авторы запустили собственный ежедневный скрейпер по всем публичным моделям и объединили полученные помесячные дельты с отфильтрованной базой. Производные модели отслеживаются по тегу base_model: учитываются только потомки наблюдаемых моделей с более чем пятью скачиваниями, исключая перезалитые версии в форматах GGUF и MLX, которые иначе завышали бы статистику дообучений для небольших популярных моделей.

Используются ещё три источника данных. OpenRouter предоставил ежемесячные списки топ-10 открытых моделей по объёму сгенерированных токенов: это отражает реальное использование, а не просто скачивания, хотя и занижает долю организаций, трафик которых распределён по большому числу моделей. Рейтинг Arena со скорректированным по стилю коэффициентом Elo даёт срез человеческих предпочтений: оценки до 19 мая 2025 года сдвинуты вверх на 59,2 балла из-за перекалибровки платформы, а лучший балл каждого региона зафиксирован монотонно, чтобы технологический фронтир двигался только вперёд. Индекс Artificial Analysis Intelligence Index даёт оценки в бенчмарках с линейной аппроксимацией по каждому региону.

Модели разделены на семь категорий по размеру: до 1B, 1-5B, 7-9B, 10-50B, 50-100B, 100-250B и более 250B параметров. Категория 7-9B выделена отдельно, поскольку в ней сосредоточены Llama 8B, Mistral 7B и Qwen 7B, и на неё одну приходится 33,8% всех скачиваний; модели меньше 10B параметров забирают около 75%. Модели архитектуры mixture-of-experts считаются по общему числу параметров, поэтому DeepSeek-R1 (671B всего, 37B активных) попадает в категорию 250B+. Регион определяется по штаб-квартире выпустившей организации, что авторы называют неидеальным приближением. Вся Европа при этом представлена лишь Mistral и Hugging Face.

Раздел ограничений написан откровенно. ModelScope и другие платформы не учитываются. Если компания скачивает модель один раз и разворачивает её на собственной инфраструктуре, это считается за одно скачивание; то же относится к облачным провайдерам, кеширующим веса. С другой стороны, CI-пайплайны, боты и повторные загрузки завышают показатели, особенно для небольших моделей и моделей с новыми архитектурами, которые часто используют как тестовые фикстуры. В защиту методики авторы отмечают, что все доступные им сигналы реального использования сильно коррелируют с данными по скачиваниям.

Распространение по регионам

Данные выделяют три эпохи, в каждой из которых один регион удерживал более 50% скачиваний и дообучений. Сначала лидировала Европа - исключительно за счёт Mistral 7B и Mixtral 8x7B. Затем лидерство перехватили США с релизом Llama 3, чему способствовал широкий выбор доступных размеров. После выхода DeepSeek V3, R1 и Qwen3 вперёд вышел Китай и с тех пор лишь увеличивает отрыв. Китай обошёл США в конце июля 2025 года.

К марту 2026 года отслеживаемое число скачиваний достигло 2,04 миллиарда против 339 миллионов в марте 2025 года (рост в шесть раз). Китай за этот год вырос с 97 млн до 1,15 млрд (в 11,9 раза), США - со 177 млн до 723 млн (в 4,1 раза), а ЕС - с 65 млн до 163 млн (в 2,5 раза). Разрыв между Китаем и США увеличился с 23 млн в августе 2025 года до 428 млн.

По производным моделям сдвиг оказался ещё сильнее. Доля Китая в новых дообучениях выросла с 10% в ноябре 2023 года до 70% в феврале 2026 года, тогда как доля ЕС упала с пиковых 58% в январе 2024 года до 4%. Сильнее всего изменился объём инференса: доля китайских моделей в открытом токен-трафике на OpenRouter выросла с 2,8% до 72,7% за 14 месяцев к январю 2026 года.

Производительность двигалась в том же направлении, но с меньшим отрывом. На Arena лучшая открытая модель Китая обошла модель США в декабре 2024 года с выходом DeepSeek V3 и удерживает лидерство до сих пор. На Artificial Analysis лучший результат Китая среди открытых моделей вырос вчетверо за 18 месяцев, достигнув 68,4 к январю 2026 года. Авторы объясняют переход небольшого преимущества по качеству в подавляющее преимущество по внедрению тем, что при выборе открытой модели пользователи обычно сразу берут лучший доступный вариант.

Распространение по организациям

Центральное место в этой динамике занимает Qwen. В сентябре 2025 года линейка обошла Llama по общему числу скачиваний (325,4 млн против 323,7 млн), а к марту 2026 года набрала 942,1 млн скачиваний - почти вдвое больше, чем у Llama (476,0 млн). В качестве основы для дообучений Qwen захватил лидерство гораздо раньше, в июне 2024 года, а его доля среди новых производных моделей выросла с 1% в январе 2024 года до 69% в феврале 2026 года. В то же время доля Meta достигла пика в 44% в августе 2024 года и затем опустилась до 11%. Поворотным моментом авторы называют выход Qwen 2.5 в сентябре 2024 года.

Основной отрыв обеспечивают модели малого размера. В феврале 2026 года Qwen показал 153,6 млн скачиваний за месяц против 71,2 млн суммарно у следующих восьми организаций вместе взятых (авторы признают, что эта цифра завышена из-за релиза Qwen3.5 в том же месяце; в декабре 2025 года соотношение было аналогичным: 87,5 млн против 61,3 млн). Шесть небольших моделей Qwen3 (от 0.6B до 8B параметров из 66 в семействе) сгенерировали 32,9 млн скачиваний в феврале - примерно столько же, сколько Zhipu AI, MiniMax, Mistral, Moonshot AI, NVIDIA и openai вместе взятые (32,8 млн).

deepseek играет другую роль. На него приходится 47% скачиваний в категории 250B+, тогда как Qwen удерживает 44% в сегменте до 10B; класс сверхкрупных моделей - единственный, где Qwen не лидирует. DeepSeek обогнал Mistral по общему числу скачиваний лишь в январе 2026 года (128,2 млн против 124,3 млн), однако его доля в инференсе существенно превышает долю по скачиваниям: на V3 и R1 в июне 2025 года приходилось до 75,6% токенов открытых моделей на OpenRouter, а в январе 2026 года - всё ещё 31,1%.

У остальных лидеров траектории короче. Mistral возглавлял рейтинг производных моделей с долей 57% в декабре 2023 года, но так и не смог превратить это в рост скачиваний. Модели линейки GPT-OSS от OpenAI, выпускавшиеся с сентября 2025 года, к весне 2026 года обогнали по ежемесячным скачиваниям всё историческое портфолио Mistral. Meta занимает второе место по общему числу скачиваний, но затормозила после Llama 4, а её доля токенов на OpenRouter упала с пиковых 37,4% в январе 2025 года до нуля к августу 2025 года.

Лаборатории, известные крупными китайскими MoE-моделями (MiniMax, Moonshot AI, Z.ai), сильно отстают от лидеров по внедрению, хотя и растут. Данные OpenRouter также показывают, насколько быстро модель может набрать популярность без заметного следа в скачиваниях: MiMo-V2-Flash от Xiaomi (MoE на 309B параметров, вышедшая в декабре 2025 года) с нуля заняла 27,2% токенов среди открытых моделей к январю 2026 года. Американские проекты, отслеживаемые с августа 2025 года, на этом фоне невелики: у NVIDIA к концу марта 2026 года набралось 30,7 млн скачиваний, у olmo от Ai2 - 14,8 млн, у Granite от IBM - 8,6 млн (суммарно около 56 млн против 942,1 млн у Qwen).

Метрика относительного внедрения (RAM)

Прямой подсчёт скачиваний отдаёт предпочтение малым моделям: модель на 1.5B параметров регулярно скачивают в 10-50 раз чаще, чем модель на 400B. Главный методический вклад отчёта - метрика относительного внедрения (Relative Adoption Metric, RAM), сравнивающая модель с конкурентами в том же весовом классе на том же этапе жизненного цикла:

RAM(m, t) = D(m, t) / C10(b, t)

Здесь D(m, t) - накопленные скачивания модели m через t дней после релиза, а C10(b, t) - 10-й по величине показатель скачиваний в этой весовой категории на аналогичный день с момента релиза. Метрика рассчитывается для 7, 14, 30, 60, 90, 180 и 365 дней; любое значение выше 1.0 означает попадание в топ-10 своей категории. 10-е место используется вместо среднего арифметического, поскольку распределение настолько скошено, что в категории 1-5B одна взрывная модель сдвигает среднее значение примерно на порядок. Пороговые значения зафиксированы монотонно, а базовые показатели обновляются ежеквартально; в тексте приведены данные на базе Q2 2026 года.

Самые сильные результаты по этой метрике показали американские модели. В категории 100-250B модель GPT-OSS 120B показала результат 19.19x на 7-й день и сохраняла 20.31x на 180-й день, а Nemotron Super 120B стартовала с 16.96x и 19.38x на 7-й и 14-й дни, удерживая 10.96x на 60-й день. Авторы видят в этом подтверждение того, что модели из США сохраняют относительную популярность долгое время после выпуска. Обратный пример - MiniMax M2.1, чья метрика упала с 4.16x на 7-й день до 0.78x на 90-й.

В категории 250B+ модель GLM-5 достигла 20.21x на 30-й день и 7.43x на 90-й, тогда как GLM 4.7 и DeepSeek V3.2 так и не перешагнули порог топ-10. Kimi K2.5 стартовала скромно с 1.64x, но поднялась до 9.55x к 90-му дню. Запуск Qwen3.5 наглядно показывает, почему для малых моделей важна нормализация: Qwen3.5-4B показала 6.97x на 7-й день, что кажется внушительным, пока не выясняется, что порог топ-10 в классе 1-5B составлял всего 24 тысячи скачиваний на 7-й день и 1,5 миллиона на 60-й. DeepSeek OCR (3B) стартовал в той же категории выше - 12.68x и 15.45x. Самым ярким успехом у Qwen стала модель Qwen3.5-35B-A3B: 10.44x через неделю и 8.75x через два месяца.

На что обратить внимание при чтении

Две цифры в отчёте расходятся друг с другом. В методической части сказано, что на отслеживаемые модели приходится более 3 миллиардов скачиваний за исследуемый период, тогда как в региональном разделе общее число скачиваний к марту 2026 года составляет 2,04 миллиарда - что в точности равно сумме показателей трёх регионов. Отчёт не объясняет этот зазор; возможная причина - модели организаций за пределами трёх указанных регионов, но в тексте об этом прямо не говорится.

Вывод по метрике RAM об устойчивой популярности американских моделей опирается всего на две модели (GPT-OSS 120B и Nemotron Super) в одной весовой категории, а также на данные по скачиваниям, которые, по признанию самих авторов, завышаются ботами и CI. Это говорит лишь об исключительности конкретно этих двух релизов, что гораздо уже тезиса о возвращении позиций моделями из США; региональные итоги свидетельствуют об обратном.

Данные отчёта также корректируют цифры со страницы проекта ATOM, написанной в августе 2025 года. Там пиковая доля Meta в производных моделях оценивалась почти в 50%, а текущая - в 15%; в отчёте, благодаря более чистой фильтрации и более свежему срезу данных, указаны 44% и 11%. При расхождениях отчёт выступает более новым и точным источником. Они расходятся и в вопросе принадлежности Hugging Face: в ноябрьском списке американских разработчиков 2025 года упомянут SmolLM, тогда как в отчёте Hugging Face отнесён к Европе. Другие взгляды на ту же проблему представлены в статьях are-open-models-catching-up, how-far-behind-are-open-models и open-and-closed-models-are-on-different-exponentials, а kimi-k3 представляет собой более поздний релиз, не вошедший во временное окно отчёта.

Пробелы в источнике

Извлечённый текст содержит только прозу. Все 17 графиков сохранились лишь в виде подписей к рисункам, семь таблиц Приложения B со списками лучших моделей по категориям представлены пустыми заголовками, а Таблица 1 с точными баллами RAM по ключевым точкам отсутствует. Приведённые выше цифры взяты из основного текста и подписей. Список литературы изучен бегло и не суммаризирован; обзор смежных работ в Приложении A ссылается преимущественно на Longpre et al. об участии в экосистеме и на Foundation Model Transparency Index.