EnglishРусский Map
Olmo

Olmo 3

title
Olmo 3
type
summary
summary
Отчёт AI2 по Olmo 3 (дек 2025): полностью открытые модели Base, Think, Instruct и RL-Zero на 7B/32B с данными, кодом и чекпоинтами всех этапов
parent
olmo
tags
ai, llm, open-weights, pretraining, post-training, datasets, reasoning, reinforcement-learning
created
2026-09-14
updated
2026-09-14
lang
ru
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Olmo 3 - третье поколение семейства olmo от Allen Institute for AI (AI2) и первое, где название пишется как "Olmo", а не "OLMo". Авторство отчёта закреплено за Olmo Team с алфавитным списком авторов; среди основных контрибьюторов - Nathan Lambert, Kyle Lo, Luca Soldaini, Dirk Groeneveld и Hamish Ivison. Препринт вышел в декабре 2025 года (arXiv 2512.13961). Модели представляют собой плотные трансформеры на 7B и 32B параметров в четырёх вариантах: Olmo 3 Base; Olmo 3 Think, обученная генерировать цепочку рассуждений перед ответом; Olmo 3 Instruct, отвечающая прямо и вызывающая инструменты; и Olmo 3 RL-Zero - модель на 7B, обученная с помощью обучения с подкреплением напрямую из базовой модели. Более поздний раунд RL дал Olmo 3.1 Think 32B и Olmo 3.1 Instruct 32B, которые в отчёте позиционируются как флагманы. Главное утверждение отчёта заключается в том, что Olmo 3.1 Think 32B - сильнейшая полностью открытая рассуждающая модель на момент выхода, вплотную приближающаяся к Qwen 3 32B на бенчмарках рассуждений при обучении на объёме токенов примерно в шесть раз меньшем.

"Model flow"

Если в olmo-2-furious просто перечислялось то, что выложено в открытый доступ, то в Olmo 3 предмет релиза получает имя: "model flow" - полный жизненный цикл модели, включающий "каждый этап, чекпоинт, точку данных и зависимость". Аргумент строится на том, что конечный результат (даже вместе с данными) позволяет изучать только сам этот результат, тогда как промежуточные этапы дают исследователю возможность вмешаться в любой точке - например, запустить RL из дообученной на этапе midtraining базы, а не из готовой модели. Конкретное преимущество, которое способна дать только полностью открытая рассуждающая модель: цепочки рассуждений можно проследить вплоть до обучающих данных, которые их породили.

Отсюда строится и сам релиз. Веса опубликованы для финала каждого этапа (базовая модель после предобучения, midtraining'а и расширения контекста; чекпоинты SFT, DPO и RL для Think и Instruct), а также в виде промежуточных чекпоинтов. Данные выложены в двух видах: точные смеси, на которых шло обучение, и полные исходные пулы, из которых производилась выборка - 9T токенов для предобучения, 2T для midtraining'а и 640B для расширения контекста. Для исследовательских групп с ограниченными вычислительными ресурсами подготовлены меньшие выборки на 150B и 10B токенов. Кодовая база включает OLMo-core для предобучения и SFT, Open Instruct для DPO и RL, datamap-rs и дедупликатор Duplodocus на Rust для обработки данных, рецепты dolma3, набор для оценки OLMES и новый инструмент деконтаминации decon. Набор для сравнения изменился со времён OLMo 2: полностью открытыми аналогами теперь выступают Marin от Стэнфорда, Apertus и K2-V2 от LLM360, и Olmo 3 Base заявляет о превосходстве над каждым из них.

Затраты в астрономическом времени

В отчёте избегают единой суммы в долларах, отмечая, что формат вроде "$5,576M в часах H800" у DeepSeek V3 стал привычным стилем, и вместо этого приводят затраченное время. От старта предобучения до оценки первой Olmo 3 Think 32B ушло около 56 дней на 1024 ускорителях H100, что авторы оценивают в $2,75M при ставке $2 за H100-час: около 47 дней на три базовых этапа (включая восстановление после сбоев) и 9 дней на пост-обучение, большая часть которого ушла на перебор гиперпараметров и оценку. Olmo 3.1 Think 32B получилась за счёт продления лучшего прогона RL ещё на 21 день на 224 GPU.

Базовая модель

Архитектура почти не изменилась по сравнению с OLMo 2: 32 слоя и ширина 4096 с multi-head attention для 7B, 64 слоя и ширина 5120 с 40 головами запросов (query) и 8 головами ключей/значений (key-value) для 32B, тот же токенизатор на базе cl100k, QK-norm, RMSNorm после подслоёв и z-loss. Изменились две вещи. Контекст предобучения удвоен до 8192 токенов, а в трёх из каждых четырёх слоёв используется sliding-window attention на 4096 токенов (последний слой всегда полноразмерный), чтобы длинные последовательности оставались доступными по вычислительным затратам. OLMo-core обучает 7B со скоростью 7700 токенов в секунду на GPU (около 43% MFU), а 32B - со скоростью 1960 токенов (41%).

Обучение базовой модели состоит из трёх этапов. 7B проходит предобучение на 5,93T токенов (ровно одна эпоха смеси), а 32B - по тому же графику, обрезанному на 5,5T с удвоенным размером батча (8M токенов). Midtraining занимает 100B токенов; для 32B его прогоняют дважды с разным порядком данных и усредняют результаты, поскольку такое слияние дало почти балл на тестах STEM с несколькими вариантами ответов и до 2,9 балла на математике, тогда как у 7B подобного прироста не наблюдалось, и там используется одиночный прогон. Расширение контекста добавляет 50B токенов для 7B и 100B для 32B.

OlmoBaseEval

В AI2 перестроили систему оценки базовых моделей, поскольку решения по данным принимаются на малых прокси-моделях, результаты которых в математике, коде и тестах с выбором ответа находятся на уровне случайного угадывания. OlmoBaseEval включает 43 задачи - вчетверо больше, чем в OLMo 2. Они сгруппированы путём кластеризации 23 тысяч оценок от 70 открытых моделей: бенчмарки, ранжирующие модели одинаково, считаются измеряющими одно и то же. Малые модели оцениваются по набору "Base Easy" с метрикой в битах на байт (bits per byte), которая даёт сигнал раньше, чем точность (accuracy), а бенчмарки с плохим соотношением сигнал/шум (например, BoolQ) были исключены. MMLU-Pro, DeepMind Math, LBPP и BBH вынесены в отложенную выборку.

Dolma 3 и пайплайн предобучения

Смесь Dolma 3 Mix насчитывает 5,93T токенов, отобранных из пула объёмом 9,31T: веб-текст Common Crawl - 4,51T (76,1%), научные PDF из olmOCR - 805B (13,6%), код Stack-Edu - 409B (6,9%), FineMath - 152B (2,6%), LaTeX из arXiv - 50,8B и Википедия - 2,5B.

Веб-пайплайн начинается со 104 дампов Common Crawl вплоть до конца 2024 года - 252,6 млрд документов. Эвристическая фильтрация в стиле DCLM сокращает их на 84,6%, до 38,8 млрд. Точная дедупликация, MinHash и новая дедупликация подстрок через суффиксные массивы затем уменьшают число документов ещё на 75%, до 9,7 млрд. Цель состоит в том, чтобы сначала удалить все повторы, а затем намеренно добавить их обратно там, где качество максимально. Документы распределяются по 24 темам и 20 уровням качества в каждой - всего 480 корзин на пуле в 8T токенов.

Научные PDF заменили использовавшиеся ранее статьи peS2o. AI2 самостоятельно скачивал их краулером AI2Bot с соблюдением robots.txt и без обхода пейволлов, а затем перевёл 238 млн PDF в текст с помощью своей модели olmOCR. После фильтрации осталось 108 млн. Шаг очистки персональных данных учитывает тип документа: модели Gemma 3 определяют, предназначен ли документ для открытой публикации. Статья с конференции с указанием имён авторов сохраняется, а банковская выписка с теми же данными удаляется. То, сколько веб-данных остаётся доступно на таких условиях, рассматривается в consent-in-crisis-ai-data-commons.

Пропорции смешивания определяются ансамблем прокси-моделей на 30M параметров: каждая обучается на 3B токенов отдельной смеси, после чего регрессия по каждой задаче предсказывает оптимальный состав при ограничении около 4-7 повторов на домен. В итоге смесь заметно смещается в сторону науки, математики и программного обеспечения. Внутри каждой темы плоская фильтрация заменена взвешенным по качеству апсемплингом: вместо того чтобы сохранять только верхний квартиль один раз, нижняя часть диапазона качества отбрасывается, а лучшие документы повторяются до 7 раз.

Midtraining

Смесь Dolma 3 Dolmino Mix насчитывает 100B токенов, отобранных из пула в 2,19T, а её назначение расширяется: от "математической заплатки" в OLMo 2 до пяти направлений - математика, код, QA, следование инструкциям и рассуждения. Наборы-кандидаты тестируются через microannealing (5B токенов кандидата плюс 5B веб-данных по сравнению с 10B чистого веба), и перспективные попадают в полноценные интеграционные прогоны на 100B токенов. За каждым следует быстрый этап SFT, чтобы проверить, сохраняется ли прирост базовой модели после пост-обучения. Всего было проведено пять раундов; одна лишь математика потребовала 25 источников и 80 прогонов microannealing.

Лицензирование напрямую влияет на состав смеси. Некоторые из лучших синтетических датасетов генерировались моделями Llama и наследуют лицензию Llama, которая требует обязательного присутствия слова "Llama" в названии любой обученной на них модели. AI2 перегенерировал их с помощью Qwen3 по тем же промптам: CraneMath воспроизводит SwallowMath (+18,5 к MATH и +27,4 к GSM8K на microannealing), MegaMatt воспроизводит MegaMath-Web-Pro-Max, а CraneCode - SwallowCode. Новые синтетические наборы добавляют вариации задач в стиле MATH, переписанные вопросы и ответы из Reddit и Википедии, а также цепочки рассуждений, выстроенные вокруг таких навыков, как возврат назад (backtracking), наряду с готовыми цепочками из QwQ, Gemini и OpenThoughts2, SFT-данными Tülu 3, Flan и высококачественным веб-текстом.

Добавление специальных диалоговых токенов вроде <|im_start|> в данные midtraining'а приводило к тому, что базовая модель выдавала их при инференсе, из-за чего результат на GSM8K падал с 49,4 до 0 (в то время как те же данные в текстовом диалоговом формате давали 46,0). Поэтому специальные токены оставили для этапа SFT. Включение данных с инструкциями и рассуждениями улучшило все метрики базовой модели, а не только показатели пост-обучения. Перекос смеси приводит к компромиссам между доменами: смесь с упором на математику, код и рассуждения повышала математику и код, но ухудшала результаты в тестах с выбором ответа и QA, а смесь с преобладанием QA почти не помогала в QA, нанося при этом ущерб математике. Проверка на деконтаминацию показала, что основная часть утечек происходила из устоявшихся датасетов вроде Flan и Nemotron - часто целыми валидационными или тестовыми сплитами по шаблонам, - и привела к удалению более 60 000 обучающих примеров DROP. Контаминация завышала некоторые оценки (DROP, Minerva, SQuAD), но не все: полная утечка GSM8K на практике показала результат ниже, чем на чистых данных, что в отчёте (вслед за авторами Marin) объясняется несовпадением формата утечки с форматом оценки.

Длинный контекст

Olmo 3 - первая модель в семействе OLMo с поддержкой длинного контекста: он расширен с 8192 до 65 536 токенов. Данные представлены Dolma 3 Longmino, собранной в основном из PDF olmOCR: 22,3 млн документов длиннее 8K токенов (640B токенов) и 4,5 млн длиннее 32K (380B). В отчёте этот массив назван крупнейшей открытой коллекцией для исследований длинного контекста. Смесь состоит на 34% из длинных документов и на 66% из коротких данных midtraining'а: обратная пропорция стоила 2,5 балла на задачах с коротким контекстом против 0,8. YaRN применяется только к слоям с полным вниманием, документы упаковываются по принципу best-fit с внутридокументным маскированием, а в длинные статьи вставляются синтетические задачи на агрегацию, сгенерированные OLMo 2 Instruct 32B. На бенчмарке RULER при длине 65K версия 32B набирает 79,7 балла, приближаясь к Qwen 2.5 32B (80,7) и уступая Mistral Small 3.1 24B (88,8); модель 7B набирает 68,0. Этап расширения контекста приводит к некоторой потере качества в математике на коротком контексте: составной балл 7B по математике снижается с 59,8 после midtraining'а до 54,4 после расширения.

По сравнению с OLMo 2 базовые модели стали значительно сильнее в математике, коде и естественных науках и немного слабее в общих знаниях, что авторы связывают с повышенным весом тем STEM. Базовая модель на 32B опережает весь класс полностью открытых моделей на 32B на двузначное число баллов в математике (61,9 против 49,3 у Marin 32B) и коде (39,7 против 30,8) и отстаёт всего на несколько баллов от Qwen 2.5 32B.

Olmo 3 Think

Для Think используются три этапа пост-обучения там, где большинство открытых рассуждающих моделей обходились одним или двумя (OpenThoughts3 и s1 использовали только SFT, SmolLM - SFT и DPO). Датасет Dolci Think SFT содержит около 2,27 млн промптов с цепочками рассуждений в основном из QwQ-32B и DeepSeek R1, отфильтрованных по лицензиям, неполным цепочкам, неудачной верификации, упоминаниям других разработчиков или дат среза знаний, повторам и "избыточному количеству китайских иероглифов или отражению китайских политических ценностей в цепочках рассуждений". Перенос SFT на OLMo-core ускорил обучение в 8 раз.

Этап DPO стал самым интересным результатом пост-обучения в отчёте. Дальнейший SFT на цепочках от Qwen3 32B ухудшил модель (средний балл снизился с 70,3 до 64,5), что авторы расценили как насыщение имитации. Объединение тех же цепочек в качестве "выбранных" (chosen) с ответами от Qwen3 0.6B в качестве "отвергнутых" (rejected) и запуск DPO подняли средний балл до 72,9. Идея "delta learning" заключается в том, что качество пары предпочтений определяется разрывом между двумя ответами, а не качеством каждого из них по отдельности, поэтому слабый отвергнутый ответ делает пару полезной. Прирост проявляется как в pass@k, так и в pass@1, что в отчёте трактуется как доказательство расширения круга задач, которые модель способна решать.

Для RL используется OlmoRL - вариант GRPO с модификациями из DAPO и Dr GRPO: отбрасывание групп, где все награды одинаковы, посимвольная нормализация потерь (token-level loss normalization), отказ от штрафа за KL-дивергенцию, повышенный верхний порог отсечения (clip), усечённая выборка по значимости (truncated importance sampling) для компенсации расхождений между вероятностями vLLM и трейнера, а также отказ от деления на стандартное отклонение группы. Награды формируются верификаторами для математики (сравнение через SymPy), кода (тест-кейсы на AWS Lambda) и ограничений инструкций, а также судьёй на базе Qwen3 32B для диалогов. Dolci-Think-RL содержит около 105 тысяч промптов. Смешивание доменов снизило награду во время обучения, но не итоговые оценки, а обучение исключительно на следовании инструкциям подняло IFEval при падении AlpacaEval, что в отчёте интерпретируется как сдерживание reward hacking'а за счёт разнообразия смеси. RL, запущенный от DPO-модели, превзошёл RL от SFT по всем метрикам.

Инференс определяет основную долю затрат на RL. В прогоне на 32B использовалось 8 узлов для обучения и 20 узлов для генерации сэмплов (rollouts) средней длиной свыше 10K токенов, причём обучающий модуль проводил 75% времени в ожидании. Асинхронные акторы, continuous batching (статический батчинг привёл бы к потере до 54% вычислительных мощностей генерации), "active sampling" для непрерывного заполнения батчей полезными примерами и применение обновлений весов без остановки генерации подняли пропускную способность бенчмарка с 881 до 2949 токенов в секунду, а прогон RL для 7B Think сократили с 15 дней до 6.

Olmo 3.1 Think 32B продолжила RL с 750 до 2300 шагов без выхода на плато, прибавив более 4 баллов на AIME, 4 на IFEval и 20 на IFBench, потеряв при этом 5 баллов на AlpacaEval. Сравнение с Qwen 3 32B показывает текущее положение: AIME 2025 - 78,1 против 70,9, IFBench - 68,1 против 37,3, но MMLU - 86,4 против 88,8, GPQA - 57,5 против 67,3 и LiveCodeBench - 83,3 против 90,2. Версия 7B Think уступает Qwen 3 8B в знаниях, что авторы объясняют дистилляцией малых моделей Qwen 3 из флагманских моделей линейки; см. llm-distillation.

Olmo 3 Instruct и RL-Zero

Instruct создана для привычного сценария, когда пользователю нужен краткий ответ. Её SFT стартует с чекпоинта Think SFT, что добавило 3,3 балла в среднем без сохранения следов цепочек рассуждений в ответах, и дополняется данными по вызову функций: траекториями агентов с реальными MCP-серверами для поиска научной литературы и веб-поиска, а также 200 тысячами смоделированных траекторий. DPO объединяет пары delta-learning с парами, оценёнными GPT. При этом простая модернизация пайплайна судейства из OLMo 2 не сработала, поскольку все модели в пуле были высокого качества, из-за чего отсутствовал контраст между выбранными и отклонёнными ответами. Проблему решило принудительное добавление слабых моделей в пул с выбором худшего ответа в качестве отклонённого. Данные предпочтений также склонны поощрять длину, поэтому диалоговые пары отфильтровали с ограничением разницы в длине максимум в 100 токенов; более краткая DPO-модель показала результат ниже в математике, но послужила лучшей отправной точкой для RL, который затем улучшил оба аспекта. Olmo 3.1 Instruct 32B достигает 57,9 на AIME 2025 против 21,3 у Qwen 3 32B с отключённым режимом рассуждений.

RL-Zero появилась потому, что стандартные открытые бенчмарки RLVR обучаются на открытых базовых моделях с неизвестными данными предобучения, поэтому прирост может быть следствием контаминации: на таких моделях случайные награды нередко работают не хуже реальных. В Olmo 3 весь пайплайн прозрачен. Модель на 7B обучается с помощью RL напрямую на математике, коде, следовании инструкциям, диалогах и их смеси с использованием очищенных от контаминации промптов и простых шаблонов вместо тегов ``. В качестве отрицательного контроля обучение со случайными наградами не дало никаких улучшений ни на одном бенчмарке, что авторы приводят как доказательство успешности деконтаминации. RL-Zero также выступает проверкой для данных midtraining'а: базовая модель без достаточного объёма данных рассуждений так и не научилась удлинять свои ответы в процессе RL.

На странице Nathan Lambert о проекте ATOM Olmo 3 32B Think названа лучшей полностью открытой рассуждающей моделью, о чём полезно знать с учётом того, что он входит в число её основных авторов.