EnglishРусский Map

Масштабирование ёмкости фактов

title
Масштабирование ёмкости фактов
type
concept
summary
Хранимые факты масштабируются лог-линейно от числа параметров и не сжимаются - предел шенноновской энтропии, не подпадающий под Densing Law
tags
llm, scaling-laws, benchmarks
created
2026-05-13
updated
2026-05-13
lang
ru
source_updated
2026-05-13
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-medium

Параметры LLM выполняют как минимум две функции: хранят факты и вычисляют функции. Они масштабируются по-разному. Процедурные способности - рассуждения, парсинг, следование инструкциям - сжимаются при переходе к более новым архитектурам, рецептам обучения и наборам данных; это Densing Law (Huang et al. 2025), когда объём возможностей на параметр удваивается примерно каждые 3.5 месяца на стандартных бенчмарках. Фактические знания не сжимаются. Снизу их ограничивает шенноновская энтропия сохраняемых ассоциаций: для хранения F фактов требуется не менее F, делённого на число бит на параметр, а количество бит на параметр имеет эмпирический потолок около 2-4 (Allen-Zhu & Li 2025; Morris et al. 2025).

Бенчмарк IKP Боцзе Ли (Bojie Li) напрямую измеряет это различие. На 96 датированных моделях с открытыми весами с конца 2023 по апрель 2026 года подгонка регрессии pen_acc = β₀ + β₁·log₁₀(N_B) + β₂·months даёт β₂ = -0.0010/месяц, 95% CI [-0.0031, +0.0008] - неотличимо от нуля, что отвергает предсказание Densing в +0.0117/месяц при p < 10⁻¹⁵. Ёмкость фактов не сжимается.

Почему это важно

Широко обсуждаемое "насыщение бенчмарков рассуждений" - MMLU, HELM, математических соревнований - многие восприняли как доказательство того, что масштабирование перестало окупаться. Измерения IKP говорят об обратном: насыщение доказывает лишь то, что бенчмарки перестали измерять ту часть масштабирования, которая не поддаётся сжатию. Бенчмарки на рассуждения измеряют процедурные способности, где Densing Law действительно работает. Бенчмарки фактов, созданные для проверки длинного хвоста редких знаний, продолжают показывать лог-линейный прирост с увеличением числа параметров.

Следствие для прогнозирования возможностей: если ваш прогноз звучал как "возможности моделей выйдут на плато к 2027 году из-за насыщения бенчмарков", вы экстраполировали не те метрики. Более крупные модели продолжают сохранять больше фактов с примерно постоянной лог-линейной скоростью, а длинный хвост знаний бездонен - уровень T7 в IKP даёт 0% на всех текущих моделях, включая те, чьё эффективное число параметров оценивается в несколько триллионов.

Декомпозиция

N_total = N_fact + N_proc + N_ling

  • N_fact - доля, выделенная под атрибуты сущностей, даты, имена, конкретные утверждения. Ограничена снизу шенноновской энтропией сохраняемых фактов; несжимаема.
  • N_proc - доля, выделенная под рассуждения, парсинг, следование инструкциям, работу с инструментами. Сжимаема; подпадает под Densing Law.
  • N_ling - доля, выделенная под синтаксис, морфологию, словарный запас, регистр речи. Сжимаема.

Более совершенные архитектуры и рецепты обучения повышают эффективность N_proc и N_ling, освобождая ёмкость для N_fact или позволяя уменьшить общее N. Они не могут уменьшить N_fact для фиксированного корпуса фактов. IKP проверяет именно N_fact.

Диапазон в 2-4 бита на параметр

Allen-Zhu & Li 2025 показали, что при идеальном обучении трансформерные модели хранят около 2 бит фактических знаний на параметр, а эмпирические оценки для моделей семейства GPT доходят примерно до 3.6 бит на параметр (Morris et al. 2025). Lu et al. 2024 показали, что ёмкость фактов масштабируется линейно с размером модели и экспоненциально с числом эпох обучения, оценивая запоминание всех фактов Wikidata при 100 эпохах примерно в 1 000 млрд параметров. Диапазон в 2-4 бита/параметр задаёт верхнюю границу того, какие факты заданный бюджет параметров способен сохранить; IKP же измеряет то, какие факты он действительно сохраняет при обучении на реальном корпусе.

Что оценивает IKP

Обращение калибровочной кривой, построенной по 89 моделям с открытыми весами, позволяет оценить эффективное число параметров любой закрытой модели через её black-box API. Расход в пять долларов на API для набора из 1400 проб даёт оценку числа параметров с медианной ошибкой 1.59x, при этом 87.6% оценок укладываются в диапазон 3x от истинного размера. В литературе это единственный внутренний (intrinsic) метод оценки размера закрытых моделей - альтернативы опираются на экономику инференса (Epoch AI 2024) и несут неопределённость 2x+ из-за допущений о стеке обслуживания (serving stack).

Полная таблица оценок frontier-моделей приведена на странице incompressible-knowledge-probes; основные цифры: GPT-5.5 ~9.7T, Claude Opus 4.6 ~5.3T, GPT-5 ~4.1T, Gemini 2.5 Flash ~207B, Claude Haiku 4.5 ~65B.

Три следствия

Общее число параметров MoE предсказывает знания, а не активное. R² равен 0.79 для общего числа параметров против 0.51 для активных. Фактические знания распределены по весам всех экспертов, а не только тех, к которым направляется каждый токен. См. mixture-of-experts.

Тариф Pro почти не добавляет ёмкости фактов. Прибавка у GPT-5 Pro даёт 1.05x эффективной ёмкости; у GPT-5.5 Pro - 1.13x. Тарифы Pro добавляют рассуждения, агентные возможности и работу с длинным контекстом (сжимаемые процедурные вещи), а не новые факты.

Thinking mode помогает извлечению, а не хранению. В среднем +2.2 процентных пункта на IKP по 27 парам base/think, причём выигрыш достигает пика на T3-T4 и сходит на нет на T7. Объём сохранённых знаний фиксирован; chain-of-thought меняет лишь то, к чему удаётся получить доступ.

Симметричное наблюдение на малых масштабах

scaffold-model-fit приводит аналогичный аргумент относительно бенчмарков для агентов написания кода: результаты измеряют взаимодействие модели и scaffold'а, а не модель саму по себе, и бенчмарки, созданные для одного режима, неверно оценивают другой. Оба аргумента указывают на одну и ту же структурную проблему: бенчмарки фиксируют допущения о том, какую именно часть возможностей они измеряют, а сдвиги в возможностях могут опережать эти допущения в любую сторону.

Ссылки

  • incompressible-knowledge-probes - исходная статья, полные результаты
  • mixture-of-experts - обновлено с учётом данных о сравнении общего и активного числа параметров
  • scaffold-model-fit - симметричный аргумент о слепых зонах бенчмарков
  • thinking-mode-rule-erosion - обновлено с учётом данных IKP по уровням сложности для thinking mode
  • no-silver-bullet-llms - аргумент Беннетта в основном касается процедурных способностей и относится к стороне Densing Law; предел несжимаемых знаний - это отдельная ось, где прогресс продолжается