Olmo
- title
- Olmo
- type
- entity
- summary
- Семейство полностью открытых языковых моделей от AI2: от OLMo (2024) до OLMo 2 и Olmo 3, с данными, кодом, чекпоинтами и логами
- tags
- ai, llm, open-weights, pretraining, datasets
- sources
- pythia-suite-for-analyzing-llms, olmo-accelerating-the-science-of-language-models, olmo-2-furious, olmo-3-technical-report
- created
- 2026-09-14
- updated
- 2026-09-14
- lang
- ru
- translation_of
- olmo
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Olmo - семейство языковых моделей от Allen Institute for AI (AI2, пишется также Ai2). Каждый релиз включает не только веса, но и обучающие данные, код обучения и оценки, промежуточные чекпоинты и логи обучения под лицензией Apache 2.0 (где это позволяют данные). AI2 называет такой подход "полностью открытым" (fully open) или "по-настоящему открытым" (truly open). Название писалось как OLMo (Open Language Model), пока в третьем поколении не сменилось на Olmo 3.
Линейка
| Релиз | Дата | Размеры | Токены | Что изменилось |
|---|---|---|---|---|
| OLMo | Фев 2024 | 1B, 7B | от 2T до 2.46T | Первый релиз; корпус Dolma; SFT и DPO в Tülu 2 |
| OLMo 1.7 / OLMo-0424 | Апр 2024 | 7B | не указано в источниках | Улучшенные смесь данных и curriculum; MMLU вырос на 24 пункта до 52% |
| OLMo 2 | Ноя 2024 - мар 2025 | 1B, 7B, 13B, 32B | от 4T до 6.6T | Исправления стабильности; mid-training на Dolmino; Tülu 3 с RLVR |
| Olmo 3 и 3.1 | Окт - дек 2025 | 7B, 32B | около 6.05T - 6.2T | Варианты для рассуждений, instruct и RL-Zero; контекст 65K; Dolma 3 |
Траектория развития шла от доказательства самой возможности полностью открытой модели к конкуренции с моделями с открытыми весами по вычислительной эффективности. Первый OLMo был "на равных" с Llama 2 7B в задачах на здравый смысл (commonsense) и уступал Tülu 2 на базе Llama 2 после instruction tuning'а. Базовые модели OLMo 2 вышли на фронтир соотношения результатов в бенчмарках к FLOP'ам на обучение в сравнении с Llama 3.1, Qwen 2.5 и Gemma 2. Olmo 3.1 Think 32B уступает Qwen 3 32B в бенчмарках на рассуждения всего несколько баллов, потребовав примерно в шесть раз меньше токенов, хотя по-прежнему отстаёт от неё в знании фактов и написании кода. Вычислительные мощности росли вместе с моделями: OLMo обучался на GPU AMD в кластере LUMI и кластере A100 от MosaicML; OLMo 2 - в основном на собственном кластере Jupiter института AI2 из 1024 H100; а обучение Olmo 3 32B от pretraining'а до первого чекпоинта Think заняло около 56 дней на 1024 картах H100. Родственная mixture-of-experts модель OLMoE использует те же данные претрейна, что и OLMo 2 (см. mixture-of-experts).
Архитектура на всём протяжении оставалась плотным декодерным трансформером (dense decoder-only transformer), а изменения в основном касались стабильности обучения при масштабировании: непараметрическая нормализация слоёв из первого OLMo уступила место RMSNorm после каждого подслоя, QK-norm, z-loss и новой инициализации в OLMo 2, а в Olmo 3 добавилось sliding-window attention на трёх из каждых четырёх слоёв.
Что означает "полная открытость" на практике
Отличие от релизов только с открытыми весами заключается в возможностях исследователя. Имея лишь веса, как в случае с Llama или Mixtral, можно только дообучать и исследовать готовую модель. С артефактами OLMo можно также восстановить точный порядок обучающих батчей, увидеть, какие данные чекпоинт видел на конкретном шаге, переобучить часть прогона с изменёнными данными, проверить утечку бенчмарка в обучающую выборку или запустить post-training с любого промежуточного этапа. С каждым техническим отчётом объём релиза расширялся. Первый OLMo вышел с весами, более чем 500 чекпоинтами, датасетом Dolma, инструментами для работы с данными, логами Weights & Biases и кодом адаптации. В OLMo 2 добавились полные смеси данных для mid-training'а и новая кодовая база для обучения. В Olmo 3 единицей релиза назван "model flow": смеси, на которых непосредственно шло обучение, более крупные пулы исходных данных для сэмплинга (9T, 2T и 640B токенов для трёх базовых этапов), чекпоинты каждого этапа и инструменты деконтаминации (decontamination).
Сохранение полной открытости требует компромиссов, которые видны во всех трёх отчётах. Данные должны иметь лицензию, допускающую распространение, что исключает синтетические датасеты, сгенерированные под лицензией Llama; для Olmo 3 некоторые из них перегенерировали с помощью Qwen3. AI2 самостоятельно собирал научные PDF-файлы с соблюдением robots.txt на фоне того, как сам веб закрывается от AI-краулеров - этот тренд описан в consent-in-crisis-ai-data-commons. Кроме того, результаты должны выдерживать внешнюю проверку, поэтому авторы отчётов сохраняют отложенные выборки (held-out) бенчмарков, публикуют методы деконтаминации и открыто признают такие детали, как использование задач GSM8K для калибровки математических данных в OLMo 2.
Связь с Pythia
Pythia (2023) от EleutherAI - идейный предшественник проекта. Она задала стандарт, на который ориентируются отчёты OLMo: открытые данные, фиксированный и воспроизводимый порядок обучения и частые чекпоинты для изучения динамики обучения. В первой статье по OLMo Pythia и BLOOM названы самыми открытыми моделями на тот момент, чекпоинты OLMo сравниваются с Pythia-6.9B, а за основу взят модифицированный токенизатор GPT-NeoX, который использовался и в Pythia. Разница - в цели. Pythia намеренно пожертвовала производительностью ради чистоты экспериментов и обучила каждую модель на 300B токенов; OLMo стремится быть одновременно открытым и конкурентоспособным, что потребовало обучения на триллионах токенов и разработки собственного рецепта post-training'а.
Nathan Lambert
Нейтан Ламберт (Nathan Lambert), автор блога interconnects, пришёл в AI2 в октябре 2023 года. Он соавтор всех трёх отчётов по OLMo, один из ключевых разработчиков OLMo 2 и Olmo 3, а также ведущий автор рецепта post-training'а Tülu 3, на котором построены OLMo 2 и Olmo 3. В эссе why-i-build-open-language-models (октябрь 2024) он называет свою работу "исследованиями уровня белого риса" (white rice research): это модели, которые "очень добротные, хотя, возможно, и не побеждают модели Llama от Meta", задокументированные на каждом шаге, чтобы другие команды могли развивать незавершённые идеи, и которые лучше воспринимать "как исследовательскую инфраструктуру, а не просто отдельные артефакты". В том же эссе признаётся, что AI2 на тот момент отставал от закрытых лабораторий в RLHF "на годы" и не отказался бы от вычислительных ресурсов в десять раз больше. В его манифесте ATOM Project (август 2025) Olmo от Ai2 стоит на первом месте среди создателей американских открытых моделей в статусе "лидера open-source", а Olmo 3 32B Think названа "лучшей полностью открытой моделью для рассуждений"; там же утверждается, что США нужны несколько лабораторий с 10 000+ GPU для обучения подобных моделей. В обоих случаях автор описывает собственный проект - это относится и к пунктам списка open-source-ai-reading-list, ссылающимся на эти отчёты.
Страницы-конспекты
- pythia-suite-for-analyzing-llms - набор из 16 моделей 2023 года от EleutherAI, обученных в едином фиксированном порядке данных для исследования динамики обучения
- olmo-accelerating-the-science-of-language-models - первый OLMo: 1B и 7B с датасетом Dolma, кодом, логами и чекпоинтами
- olmo-2-furious - OLMo 2 размером от 7B до 32B: исправления стабильности, mid-training на Dolmino и post-training по схеме Tülu 3
- olmo-3-technical-report - Olmo 3 Base, Think, Instruct и RL-Zero: релиз в формате "model flow" и фреймворк OlmoRL
- Nathan Lambert on China's AI Ecosystem and the Open Model Gap
- The ATOM Project: American Truly Open Models
- The ATOM Report: Measuring the Open Language Model Ecosystem
- Consent in Crisis: The Rapid Decline of the AI Data Commons
- The Gradient of Generative AI Release: Methods and Considerations
- Interconnects (interconnects.ai)
- Mixture of Experts (MoE)
- 2 OLMo 2 Furious
- Olmo 3
- OLMo: Accelerating the Science of Language Models
- Open models in perpetual catch-up
- Open-Source AI & Open Models Reading List
- Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling
- On the Societal Impact of Open Foundation Models
- What comes next with open models
- Why I build open language models