Проект ATOM: по-настоящему открытые американские модели
- title
- Проект ATOM: по-настоящему открытые американские модели
- type
- summary
- summary
- Меморандум Нейтана Ламберта 2025 года: США уступили Китаю лидерство в открытых моделях и нуждаются в лабораториях на 10 000 GPU
- tags
- ai, open-weights, open-source, policy, china, llm, ai-lab
- created
- 2026-09-14
- updated
- 2026-09-14
- lang
- ru
- translation_of
- atom-project-american-truly-open-models
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Нейтан Ламберт опубликовал проект ATOM на atomproject.ai 4 августа 2025 года. Это меморандум с формой для сбора подписей: описание проблемы, рекомендации по финансированию и призыв к исследователям, компаниям и благотворительным фондам поддержать инициативу. С тех пор страница продолжала обновляться. Графики на ней актуализировались вплоть до марта 2026 года, а 23 ноября 2025 года был добавлен список американских создателей открытых моделей. В своём open-source-ai-reading-list Ламберт относит этот текст к категории материалов о том, почему США необходимо инвестировать в открытые модели для фундаментальных исследований в условиях конкуренции с Китаем. Данные, положенные в основу документа, позже были расширены в atom-report-open-model-ecosystem, где политические рекомендации намеренно не даются, а читателя отсылают обратно к этой странице.
Слова "Truly open" ("по-настоящему открытые") играют важную роль в названии. В меморандуме проводится граница между моделями с открытыми весами (open-weight), у которых выложены только веса, и open source моделями, которые поставляются вместе с обучающими данными, промежуточными чекпоинтами, базовыми моделями, кодом обучения и разрешительной лицензией. Проект нацелен именно на второй вариант.
Аргументация
Исходный тезис опирается на историю. Лидерство США в сфере ИИ сформировалось благодаря тому, что страна была центром открытых исследований: Google изобрела архитектуру Transformer и открыла её миру, а академическая среда и индустрия взаимодействовали настолько тесно, что десятки тысяч студентов и исследователей могли опираться на результаты друг друга. По мнению Ламберта, этот подход стал стандартом для китайских компаний, тогда как американские о нём всё чаще забывают. Ведущие учёные США перешли в закрытые лаборатории, а "закрытые лаборатории ведут закрытые исследования". Он старается не упрекать эти лаборатории за закрытую разработку качественных продуктов; суть в том, что они охватывают лишь несколько идей, тратят почти все ресурсы на очередную модель и оставляют исследовательские вопросы с горизонтом в 2, 5 и 10 лет открытому сообществу, которое теперь в основном работает на китайских моделях.
Конкретный пример - обучение с подкреплением и проверяемыми вознаграждениями (RLVR). Это направление стало самым активным после появления первых reasoning-моделей, и большая часть работы велась на базе Qwen от Alibaba, так как Qwen была сильнейшей открытой базовой моделью для математики и кода.
Статистика внедрения в 2025 году
Меморандум иллюстрирует динамику внедрения на примере Llama от Meta. Когда вышла Llama 2, её модели набрали около 60 млн скачиваний против 10 млн у сопоставимых ранних моделей Qwen при вдвое меньшем количестве моделей в линейке. К выходу Llama 3 и Qwen 2.5 в 2024 году отрыв сократился до 20 млн, при этом обе линейки преодолели отметку в 120 млн. К августу 2025 года ведущие американские и китайские поставщики имели примерно по 300 млн суммарных скачиваний на Hugging Face, причём Китай рос быстрее, а Европа держалась около 100 млн. С производными моделями наблюдалась та же картина: на китайские модели приходилось 10-30% новых fine-tune'ов в начале 2024 года, а к середине 2025 года одна только Qwen занимала более 40%, в то время как доля Llama упала с почти 50% осенью 2024 года до 15%. Обновлённые графики показывают, что в сентябре 2025 года Qwen обогнала Llama и стала самым скачиваемым семейством.
Что касается производительности, в июле 2024 года Llama 3 опережала любую общедоступную китайскую модель. К моменту публикации меморандума в августе 2025 года все топ-10 открытых моделей на LMArena были китайскими, как и топ-3 открытых моделей на Artificial Analysis.
Вышедший позже ATOM Report скорректировал часть этих цифр благодаря более выверенной методологии. Пик доли производных моделей Meta там оценивается в 44% в августе 2024 года с падением до 11% к февралю 2026 года (в меморандуме говорилось о падении с почти 50% до 15%). Отчёт представляет собой более свежий и лучше задокументированный источник.
Диагноз Ламберта носит структурный характер и не сводится к оценке Llama 4. В Китае есть "5 потрясающих открытых лабораторий", у США была только Meta, и "мы выставляем Meta против 5 китайских бегунов, а потом жалуемся, что она не выигрывает каждый забег". Ситуацию усугубляли лицензии: условия Llama требовали юридической экспертизы, чтобы понять, разрешено ли конкретное использование, тогда как Qwen и другие китайские модели взяли простые лицензии из практики open source ПО.
Безопасность, ценности и демпинг
В более коротком разделе приводятся аргументы с позиции национальных интересов. В ряде секторов американские компании медленно внедряли китайские модели из-за опасений по поводу бэкдоров и небезопасного генерируемого кода. Ламберт признаёт, что это сложно измерить и утверждение опирается на частные беседы. Также есть опасения по поводу цензуры в ответах моделей - в качестве подтверждения приводится SpeechMap.ai. Кроме того, он проводит параллель между стремлением китайских лабораторий выпускать дешёвые открытые модели и практикой КНР по демпинговому экспорту товаров ниже себестоимости за счёт государственных субсидий.
Эта параллель не совсем вяжется с остальным текстом меморандума. Американские модели, к созданию которых он призывает, тоже должны быть бесплатными, дешёвыми в запуске и доступными для модификации - ровно то же самое предложение в случае китайских лабораторий объявляется подозрительным.
Требования и предложения
Рекомендации предельно конкретны. США следует поддерживать несколько лабораторий, каждая из которых оснащена 10 000 или более GPU класса H100, выделенных исключительно под обучение открытых моделей. В КНР было как минимум пять лабораторий, выпускавших открытые модели на уровне лучших американских или превосходящих их. Концентрация ресурсов имеет решающее значение: Ламберт утверждает, что распределение тех же средств по множеству мелких проектов не даст передовых моделей, тогда как несколько сфокусированных инициатив смогут учиться друг у друга и не разрастутся до масштабов, замедляющих работу.
Каждый центр должен создавать два типа продуктов. Первый - открытые frontier-модели, что в 2025 году означало от 100 до 600+ млрд параметров на архитектуре mixture-of-experts. Второй - линейка моделей меньшего размера, от вариантов для телефонов до облачных масштабов, поскольку для большинства задач огромная модель не нужна, а исследователям важно находить минимальный размер, решающий поставленную задачу. Топовые модели обучаются командами от пятидесяти до нескольких сотен человек. Часто упоминаемую стоимость DeepSeek V3 в 5 млн долларов он называет вводящей в заблуждение, что признавали и сами авторы deepseek; 10 000 GPU - это входной порог, позволяющий проводить быстрые эксперименты параллельно с масштабным прогоном обучения.
Финансирование должно поступать от частных компаний, благотворительных организаций и государства. Программы вроде National AI Research Resource помогают расширить доступ, но недостаточно сконцентрированы, а цель - получить открытые frontier-модели в течение 6-12 месяцев. White House AI Action Plan 2025 года трактуется как переломный момент во взгляде Вашингтона на открытые модели: преимущества признали перевешивающими оценённые риски.
Американские разработчики по состоянию на ноябрь 2025 года
Добавленный в ноябре список иллюстрирует более частный тезис: в США примерно столько же лабораторий, выпускающих качественные модели, сколько и в Китае (около 20), но американские лаборатории в основном публикуют модели меньшего размера под более строгими лицензиями, из-за чего их влияние слабее.
olmo от Ai2 назван лидером в open source: Olmo 3 32B Think названа лучшей полностью открытой языковой моделью в истории, неизменно выходящей под Apache 2.0. Nemotron от Nvidia - "пожалуй, открытый лидер в США после Llama 4", при этом Nemotron Nano 9B v2 не уступает китайским моделям своего размера и сопровождается открытой публикацией данных. gpt-oss-120b от openai, первая модель с открытыми весами со времён GPT-2, названа невероятно важной. Gemma от Google, Granite от IBM, Phi от Microsoft, SmolLM от Hugging Face, Liquid AI, Moondream, Apriel от ServiceNow, модели Trinity от Arcee/Datology/Prime Intellect и модели сообщества Marin от Стэнфорда дополняют список, в основном небольшими dense-моделями. Reflection AI фигурирует вообще без моделей, лишь с ремаркой, что привлечение 2 млрд долларов на эту задачу выглядит достаточно убедительно. Пристальнее всего следили за четырьмя игроками: Ai2, Nvidia, Arcee и Reflection.
Группа с неясным статусом весьма показательна. meta-platforms удостоилась комментария "тишина после фиаско с Llama 4", Grok от xAI отметился обещаниями релизов, которые оказались бесполезными, Reka замолчала, а Institute for Foundation Models базируется в США, но продвигал свой релиз K2-Think как "DeepSeek из ОАЭ". Cohere, Mistral и AI21 упомянуты как представители более широкого западного списка.
Последующий контекст
Две страницы в базе развивают темы из этого меморандума. У Reflection AI по-прежнему не было публичной модели в июне 2026 года, когда, согласно six-months-to-live-for-open-models, её представитель на встрече в Белом доме доказывал, что открытые модели следует исключить из системы оценки возможностей. Кроме того, сам Ламберт в более поздних работах отходит от тезиса о "китайской угрозе". В статье banning-open-source-ai-would-be-a-mistake, написанной совместно с Кевином Сюем в 2026 году, содержится предупреждение, что использование фактора Китая как повода для регулирования open source приведёт к обратным результатам, и доказывается, что прозрачность делает открытые модели более безопасными. В меморандуме риски бэкдоров и цензуры подавались как повод развивать собственные мощности внутри страны; в авторской колонке утверждается, что эти опасения не оправдывают ограничение моделей. Обе эти позиции совместимы, но акценты заметно сместились.
Пробелы в источнике
Сохранённая веб-страница неполная. В разделе FAQ есть три заголовка категорий (Open Models, AI Ecosystem, Miscellaneous), но сами вопросы и ответы не сохранились. Список подписантов пуст, а семь графиков представлены только заголовками и подписями, поэтому приведённые выше цифры взяты из текста меморандума, а не с графиков.
- Nathan Lambert on China's AI Ecosystem and the Open Model Gap
- The ATOM Report: Measuring the Open Language Model Ecosystem
- Banning Open Source AI Would Be A Mistake
- DeepSeek
- Interconnects (interconnects.ai)
- Olmo 3
- Olmo
- Open models in perpetual catch-up
- Open-Source AI & Open Models Reading List
- US Scrutiny of Chinese Model Use
- Why I build open language models