EnglishРусский Map

Olmo

title
Olmo
type
entity
summary
Семейство полностью открытых языковых моделей от AI2: от OLMo (2024) до OLMo 2 и Olmo 3, с данными, кодом, чекпоинтами и логами
tags
ai, llm, open-weights, pretraining, datasets
created
2026-09-14
updated
2026-09-14
lang
ru
translation_of
olmo
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Olmo - семейство языковых моделей от Allen Institute for AI (AI2, пишется также Ai2). Каждый релиз включает не только веса, но и обучающие данные, код обучения и оценки, промежуточные чекпоинты и логи обучения под лицензией Apache 2.0 (где это позволяют данные). AI2 называет такой подход "полностью открытым" (fully open) или "по-настоящему открытым" (truly open). Название писалось как OLMo (Open Language Model), пока в третьем поколении не сменилось на Olmo 3.

Линейка

Релиз Дата Размеры Токены Что изменилось
OLMo Фев 2024 1B, 7B от 2T до 2.46T Первый релиз; корпус Dolma; SFT и DPO в Tülu 2
OLMo 1.7 / OLMo-0424 Апр 2024 7B не указано в источниках Улучшенные смесь данных и curriculum; MMLU вырос на 24 пункта до 52%
OLMo 2 Ноя 2024 - мар 2025 1B, 7B, 13B, 32B от 4T до 6.6T Исправления стабильности; mid-training на Dolmino; Tülu 3 с RLVR
Olmo 3 и 3.1 Окт - дек 2025 7B, 32B около 6.05T - 6.2T Варианты для рассуждений, instruct и RL-Zero; контекст 65K; Dolma 3

Траектория развития шла от доказательства самой возможности полностью открытой модели к конкуренции с моделями с открытыми весами по вычислительной эффективности. Первый OLMo был "на равных" с Llama 2 7B в задачах на здравый смысл (commonsense) и уступал Tülu 2 на базе Llama 2 после instruction tuning'а. Базовые модели OLMo 2 вышли на фронтир соотношения результатов в бенчмарках к FLOP'ам на обучение в сравнении с Llama 3.1, Qwen 2.5 и Gemma 2. Olmo 3.1 Think 32B уступает Qwen 3 32B в бенчмарках на рассуждения всего несколько баллов, потребовав примерно в шесть раз меньше токенов, хотя по-прежнему отстаёт от неё в знании фактов и написании кода. Вычислительные мощности росли вместе с моделями: OLMo обучался на GPU AMD в кластере LUMI и кластере A100 от MosaicML; OLMo 2 - в основном на собственном кластере Jupiter института AI2 из 1024 H100; а обучение Olmo 3 32B от pretraining'а до первого чекпоинта Think заняло около 56 дней на 1024 картах H100. Родственная mixture-of-experts модель OLMoE использует те же данные претрейна, что и OLMo 2 (см. mixture-of-experts).

Архитектура на всём протяжении оставалась плотным декодерным трансформером (dense decoder-only transformer), а изменения в основном касались стабильности обучения при масштабировании: непараметрическая нормализация слоёв из первого OLMo уступила место RMSNorm после каждого подслоя, QK-norm, z-loss и новой инициализации в OLMo 2, а в Olmo 3 добавилось sliding-window attention на трёх из каждых четырёх слоёв.

Что означает "полная открытость" на практике

Отличие от релизов только с открытыми весами заключается в возможностях исследователя. Имея лишь веса, как в случае с Llama или Mixtral, можно только дообучать и исследовать готовую модель. С артефактами OLMo можно также восстановить точный порядок обучающих батчей, увидеть, какие данные чекпоинт видел на конкретном шаге, переобучить часть прогона с изменёнными данными, проверить утечку бенчмарка в обучающую выборку или запустить post-training с любого промежуточного этапа. С каждым техническим отчётом объём релиза расширялся. Первый OLMo вышел с весами, более чем 500 чекпоинтами, датасетом Dolma, инструментами для работы с данными, логами Weights & Biases и кодом адаптации. В OLMo 2 добавились полные смеси данных для mid-training'а и новая кодовая база для обучения. В Olmo 3 единицей релиза назван "model flow": смеси, на которых непосредственно шло обучение, более крупные пулы исходных данных для сэмплинга (9T, 2T и 640B токенов для трёх базовых этапов), чекпоинты каждого этапа и инструменты деконтаминации (decontamination).

Сохранение полной открытости требует компромиссов, которые видны во всех трёх отчётах. Данные должны иметь лицензию, допускающую распространение, что исключает синтетические датасеты, сгенерированные под лицензией Llama; для Olmo 3 некоторые из них перегенерировали с помощью Qwen3. AI2 самостоятельно собирал научные PDF-файлы с соблюдением robots.txt на фоне того, как сам веб закрывается от AI-краулеров - этот тренд описан в consent-in-crisis-ai-data-commons. Кроме того, результаты должны выдерживать внешнюю проверку, поэтому авторы отчётов сохраняют отложенные выборки (held-out) бенчмарков, публикуют методы деконтаминации и открыто признают такие детали, как использование задач GSM8K для калибровки математических данных в OLMo 2.

Связь с Pythia

Pythia (2023) от EleutherAI - идейный предшественник проекта. Она задала стандарт, на который ориентируются отчёты OLMo: открытые данные, фиксированный и воспроизводимый порядок обучения и частые чекпоинты для изучения динамики обучения. В первой статье по OLMo Pythia и BLOOM названы самыми открытыми моделями на тот момент, чекпоинты OLMo сравниваются с Pythia-6.9B, а за основу взят модифицированный токенизатор GPT-NeoX, который использовался и в Pythia. Разница - в цели. Pythia намеренно пожертвовала производительностью ради чистоты экспериментов и обучила каждую модель на 300B токенов; OLMo стремится быть одновременно открытым и конкурентоспособным, что потребовало обучения на триллионах токенов и разработки собственного рецепта post-training'а.

Nathan Lambert

Нейтан Ламберт (Nathan Lambert), автор блога interconnects, пришёл в AI2 в октябре 2023 года. Он соавтор всех трёх отчётов по OLMo, один из ключевых разработчиков OLMo 2 и Olmo 3, а также ведущий автор рецепта post-training'а Tülu 3, на котором построены OLMo 2 и Olmo 3. В эссе why-i-build-open-language-models (октябрь 2024) он называет свою работу "исследованиями уровня белого риса" (white rice research): это модели, которые "очень добротные, хотя, возможно, и не побеждают модели Llama от Meta", задокументированные на каждом шаге, чтобы другие команды могли развивать незавершённые идеи, и которые лучше воспринимать "как исследовательскую инфраструктуру, а не просто отдельные артефакты". В том же эссе признаётся, что AI2 на тот момент отставал от закрытых лабораторий в RLHF "на годы" и не отказался бы от вычислительных ресурсов в десять раз больше. В его манифесте ATOM Project (август 2025) Olmo от Ai2 стоит на первом месте среди создателей американских открытых моделей в статусе "лидера open-source", а Olmo 3 32B Think названа "лучшей полностью открытой моделью для рассуждений"; там же утверждается, что США нужны несколько лабораторий с 10 000+ GPU для обучения подобных моделей. В обоих случаях автор описывает собственный проект - это относится и к пунктам списка open-source-ai-reading-list, ссылающимся на эти отчёты.

Страницы-конспекты

  • pythia-suite-for-analyzing-llms - набор из 16 моделей 2023 года от EleutherAI, обученных в едином фиксированном порядке данных для исследования динамики обучения
  • olmo-accelerating-the-science-of-language-models - первый OLMo: 1B и 7B с датасетом Dolma, кодом, логами и чекпоинтами
  • olmo-2-furious - OLMo 2 размером от 7B до 32B: исправления стабильности, mid-training на Dolmino и post-training по схеме Tülu 3
  • olmo-3-technical-report - Olmo 3 Base, Think, Instruct и RL-Zero: релиз в формате "model flow" и фреймворк OlmoRL
Sub-pages