EnglishРусский Map

RL-дообучение за $500, обошедшее frontier-модели

title
RL-дообучение за $500, обошедшее frontier-модели
type
summary
summary
GRPO-дообучение открытой модели на 9B за $500 обошло все frontier-модели на модерации каталога и вышло в 68 раз дешевле
tags
llm, reinforcement-learning, fine-tuning, open-weights, benchmarks, cost
created
2026-07-29
updated
2026-07-29
lang
ru
source_updated
2026-07-29
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-medium

Fermisense опубликовала подробный кейс о том, как небольшую открытую модель обучили выполнять одну задачу лучше любых frontier-моделей. Задача - модерация каталога в e-commerce: по карточке товара с изображениями, названием, описанием, заявленным брендом и регионом определить правильную категорию в таксономии, извлечь обязательные для этой категории атрибуты и решить, нарушает ли товар правила площадки. В итоге модель Qwen3.5-9B с открытыми весами после GRPO-дообучения набрала 87.3% от максимально возможного балла против 76.9% у лучшей протестированной конфигурации frontier-модели. При этом стоимость составила $0.50 за 1000 карточек против $34 у сильнейшей frontier-модели.

Fermisense продаёт это как услугу, поэтому статья заканчивается ссылкой на созвон, а все цифры получены самой компанией. Прочитать её стоит из-за необычной полноты данных: опубликованы среда, функция награды, счёт за железо, время обучения, шаг, на котором модель обошла frontier, а также оценки как строгого тестового harness'а, так и более мягкого монитора процесса обучения.

Окружение - это и есть результат

Вместо набора примеров для обучения создали "цифрового двойника" рабочего процесса. Датасет Amazon Berkeley Objects (реальные фотографии товаров и данные карточек) превратили в 177 767 эпизодов проверки, по одной карточке на эпизод. Туда включили контролируемые нарушения правил, несовпадающие изображения, противоречивые заявления о бренде и заведомо легитимные товары в качестве сложных отрицательных примеров (hard negatives), так что у каждого эпизода есть известный правильный ответ.

Внутри окружения модели доступны три инструмента: search_taxonomy по примерно 13 000 категорий, lookup_brand для проверки регистрации и защиты бренда и get_attribute_schema для получения схемы обязательных атрибутов выбранной категории. Затем модель фиксирует категорию, атрибуты и вердикт по правилам площадки. Оценщик выставляет балл за каждый эпизод по формуле:

reward = 0.3·category + 0.3·attributes + 0.4·policy − tool_overage

Штрафы напрямую отражают приоритеты бизнеса: пропущенное нарушение обходится в 7 раз дороже ложного срабатывания. Задать такую асимметрию через prompt надёжно не получается, и именно она во многом определяет итоговый отрыв.

Сначала - бенчмарк frontier-моделей

Перед обучением пять frontier-моделей - GPT-5.5, GPT-5.6-sol, Gemini 3.1 Pro, Claude Opus 4.8 и Claude Fable 5 - прогнали через 200 стратифицированных валидационных эпизодов с одинаковыми инструментами, изображениями, оценщиком и лимитом шагов диалога. Тестировали две конфигурации: простой prompt и вариант с 2800 символами оптимизированных инструкций, описывающих правила извлечения, порядок вызова инструментов и примеры работы.

Из этого вышли два вывода. Оптимизированные конфигурации сошлись с разницей в десятую долю балла, что похоже на потолок возможностей, а не на реальный рейтинг, причём Gemini, сильнейшая модель в режиме zero-shot, от подробных инструкций стала работать хуже. К тому же инструкции стоили денег: они увеличили расход входных токенов на 28-55% в зависимости от модели, на каждом вызове и навсегда. Fermisense называет это "налогом на prompt" (prompt tax), и это самая точная формулировка в статье: знание о задаче, переданное в prompt'е, берётся в аренду на каждый вызов, а знание, заложенное при обучении, покупается один раз и остаётся в весах.

Причина разрыва, по оценке авторов, не в том, что frontier-модели глупее. Frontier-модель начинает каждый эпизод с нуля: она никогда не видела таксономию конкретного магазина, принятые в нём соглашения по каталогу, допустимые значения атрибутов или правила разбора пограничных случаев. Ей приходится восстанавливать всё это из prompt'а при каждом обращении. Инструкции помогают лишь отчасти. Пограничные же ситуации, от которых зависит итоговый балл, как раз невозможно перечислить никаким списком инструкций.

Процесс обучения

Два арендованных GPU RTX PRO 6000 (один генерирует rollout'ы, второй применяет обновления градиентов) и открытый фреймворк prime-rl. 1000 шагов оптимизатора, около трёх с половиной дней и примерно $500 расходов на GPU.

Большая часть этого времени не потребовалась. Модель вышла на уровень frontier-моделей примерно через 250 шагов (около суток), а оставшиеся 750 шагов ушли на выжимание максимума. Монитор W&B при сэмплировании показывает рост примерно с 0.50 до 0.671 на 1000-м шаге. Строгий тестовый harness оценивает итоговый адаптер в 0.626 (те самые 87.3%), что примерно на десять пунктов выше лучшей конфигурации frontier-моделей и на 36% лучше базовой необученной модели (64.2%).

Экономика

Конфигурация Стоимость за 1000 карточек
Специфичная дообученная 9B, self-hosted $0.50
Gemini (самый дешёвый протестированный frontier) $19
Сильнейшая frontier-модель $34
GPT-5.5-pro (самый дорогой вариант) $172

Это в 40 раз дешевле самого доступного варианта среди frontier-моделей, в 68 раз дешевле сильнейшего и примерно в 340 раз дешевле самого дорогого - при том что по качеству модель обошла их все. В масштабах Shopify (порядка 40 миллионов решений в день) разница между $34 и $0.50 за тысячу запросов превращается в $500 млн в год против $7 млн.

Дообучение добавило примерно 23 пункта к результату базовой 9B при той же цене около $0.50. В этом и заключается суть: не в том, что маленькие модели дёшевы (это и так известно), а в том, что на подобной задаче привычный компромисс между качеством и ценой исчезает вовсе.

Подобные примеры в других компаниях

В подтверждение авторы приводят данные других компаний со ссылками на их отчёты. Bridgewater дообучила открытую модель на разметке собственных инвесторов и заявляет о снижении числа ошибок примерно на 30% по сравнению с лучшей frontier-моделью. Harvey применила RL к модели с открытыми весами для юридического due diligence и подготовки меморандумов; их юридический агент превосходит GPT-5.5 и Claude Opus 4.8 по собственным критериям оценки. Intercom провела post-training специализированной модели поддержки Fin Apex на миллиардах диалогов с клиентами и отчитывается о более высоком проценте решённых вопросов при меньших затратах. Shopify классифицирует товары с помощью дообученных открытых моделей в объёме около 40 миллионов инференсов в день - при такой нагрузке коммерческие API, по их словам, экономически нецелесообразны.

В приложении собрано ещё восемь похожих примеров: AT&T суммаризирует 900 тысяч звонков в техподдержку в день и на 17% лучше находит персональные данные по сравнению с GPT-4o; подбор кандидатов в LinkedIn работает в 75 раз дешевле GPT-4; OpenPipe набирает 93% в QA для поддержки там, где o3 показала 50%, при стоимости в 64 раза ниже; классификатор фоновых проверок Checkr превосходит GPT-4 на сложнейших случаях, будучи в 5 раз дешевле и в 30 раз быстрее. Запись Cognition в этой таблице - swe-1-7, о которой в этой вики есть отдельная страница. Полезно прочитать обе: страница SWE-1.7 подробно описывает как раз те оговорки, о которых в приложении статьи умалчивается - бенчмарки запускались самими разработчиками, на их собственных тестовых стендах, а иногда и на их собственных бенчмарках. Каждая строчка здесь - это отчёт самой компании о сравнении с моделью, которую она заменяла. Тенденция достаточно устойчива, чтобы в неё поверить, но точные масштабы выигрыша независимой проверки не проходили. Здесь уместна та же осторожность, о которой говорит structured-output-benchmark: одна метрика может приукрасить возможности модели в зависимости от выбранной шкалы измерения.

Когда этот инструмент не подходит

В большинстве ситуаций ответ дают два вопроса: как часто выполняется задача и можно ли проверить результат. Дообучение окупается там, где работа одновременно масштабна по объёму и поддаётся автоматической проверке: маршрутизация тикетов, извлечение полей из документов, проверка заявок на соответствие правилам, классификация товаров, одобрение или маркировка транзакций. Проверяемые, но редкие задачи выгоднее решать с помощью frontier-моделей с оптимизированным prompt'ом. Непроверяемые задачи требуют участия человека. А если дело не в суждениях, а в меняющихся фактах, решением при любом объёме остаётся поиск (retrieval): RAG и RL решают разные проблемы, и именно поэтому цифровой двойник держит цены, остатки на складе и текст правил в инструментах, а не в весах модели.

Сформулированный авторами критерий прост и точен: если решение можно оценить в баллах, модель может натренироваться его принимать; если о нём можно только спорить - не может.

Примечание: каково это - владеть своим endpoint'ом

Короткая заметка Мэтью Зальца (Matthew Saltz), вышедшая на той же неделе, описывает тот же сдвиг с точки зрения удобства работы. Её стоит воспринимать скорее как наблюдение, чем как строгое доказательство. Он работает в Modal, где только что запустили управляемые endpoint'ы kimi-k3. Вместо того чтобы покупать расширенную личную подписку на Claude ради пет-проекта, он за пять минут перенастроил opencode на собственный endpoint. В его отзыве нет бенчмарков, только ощущение: "Endpoint принадлежит мне, и мои данные ходят только между ноутбуком и им. Чувствуешь, что всё под твоим контролем". Он сравнивает это с переходом на vim после тяжёлого навороченного редактора.

Это опыт одного разработчика за один вечер на хостинговом endpoint'е, который ему даже не пришлось администрировать, и он ничего не говорит о качестве или стоимости при больших нагрузках. Но он подводит к тому же аргументу, который приводит Fermisense в конце своего чек-листа: конфиденциальные данные, не покидающие ваш периметр, - это свойство безопасности, а не просто прихоть. local-ai-is-not-opus и titit-local-ai разбирают ту же тему со стороны self-hosted решений, но подходят к ограничениям открытых моделей гораздо строже.