EnglishРусский Map

Зонды несжимаемого знания (IKP)

title
Зонды несжимаемого знания (IKP)
type
summary
summary
Бенчмарк IKP оценивает число параметров закрытых моделей по фактической ёмкости (R²=0.917), опровергает закон Денсинга и даёт GPT-5.5 ~9.7T параметров
tags
llm, scaling-laws, benchmarks, parameter-estimation
created
2026-05-13
updated
2026-05-13
lang
ru
source_updated
2026-05-13
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-medium

Bojie Li (Pine AI, arXiv 2604.24827, 27 апреля 2026 года) создал инструмент, который оценивает число параметров закрытой LLM по тому, сколько фактов она знает. Логика простая: feed-forward-слои трансформера хранят примерно 2-4 бита фактологических ассоциаций на параметр (Allen-Zhu & Li 2025; Morris et al. 2025), поэтому для хранения F фактов требуется как минимум F, делённое на число бит на параметр, весов. Измерив F, получаем нижнюю границу числа параметров. Традиционный альтернативный подход - экономика инференса с оценкой размера по пропускной способности API и тарифам - даёт погрешность от 2 раз и выше из-за допущений об оборудовании, батчинге и стеке обслуживания. Оценка IKP внутренняя: ей нужен только доступ к API в режиме чёрного ящика.

Набор зондов

1400 вопросов, разделённых на семь уровней сложности (от T1 Universal -> до T7 Extreme), границы которых эмпирически откалиброваны по шести опорным открытым моделям: Qwen 2.5 0.5B / 7B -> Qwen 3 32B / 235B -> Kimi K2.5 -> Gemini 3.1 Pro. Зонд попадает на уровень k, если опорная модель T_k отвечает правильно, а T_{k-1} - нет. Немонотонные зонды (около 15%) отбрасываются.

Преобладают два семейства зондов. Wikidata даёт 557 зондов на атрибуты вроде года основания или столицы (T3-T7, выборка по квартилям просмотров в Wikipedia). DBLP/arXiv даёт 345 зондов об исследователях - "назовите основную область этого исследователя в CS и укажите одну статью, систему, организацию или соавтора, связанных с его работой". В T5-T7 преобладают исследователи с 10-50 цитированиями. Оставшиеся 97 зондов - ручной баланс для уровней T1-T4.

Оценка выставляется по шкале +1.0 / +0.5 / 0 / λ, где λ = -1.0 штрафует за уверенный блеф. Соотношение STRONG > WEAK > REFUSAL > WRONG по построению означает, что откалиброванная честная модель строго превосходит агрессивного блефующего при том же уровне знаний. Баллы по отдельным уровням могут уходить в минус; итоговый балл - невзвешенное среднее по семи уровням.

Калибровка

Аппроксимация A = α·log₁₀(N) + β на 89 моделях с открытыми весами в диапазоне от 135M до 1600B даёт R² = 0.917. Каждое 10-кратное увеличение числа параметров добавляет ~14.7 п. п. к точности IKP. Кросс-валидация с исключением по одному (leave-one-out): медианная ошибка 1.59x, 68.5% попадают в диапазон 2x, 87.6% - в 3x.

Три вывода, заслуживающих отдельных страниц

1. Объём знаний предсказывает общее число параметров MoE, а не активное

Для моделей Mixture-of-Experts регрессия IKP по общему числу параметров даёт R² = 0.79. По активным параметрам: R² = 0.51. Фактические знания распределены по весам всех экспертов, а не только тех, которые активируются на каждый токен. Это подтверждает давнее эмпирическое наблюдение сообщества, у которого раньше не было чёткого экспериментального подтверждения; см. mixture-of-experts, куда уже добавлен этот результат. Это согласуется с совместными законами масштабирования MoE из Ludziejewski et al. (2025) и единым масштабированием MoE из Clark et al. (2022).

2. Закон Денсинга неверен для сохранённых знаний

"Закон Денсинга" (Huang et al. 2025) утверждает, что полезная ёмкость на параметр удваивается каждые ~3.5 месяца. По 96 датированным моделям с открытыми весами с 2023-09-27 по 2026-04-24 IKP ложится в формулу:

pen_acc = β₀ + β₁·log₁₀(N_B) + β₂·months

β₂ = -0.0010/месяц (95% CI [-0.0031, +0.0008]) - неотличимо от нуля. Предсказание закона Денсинга в +0.0117/месяц отвергается при p < 10⁻¹⁵.

Здесь важна смена перспективы: процедурные способности (рассуждение, парсинг, следование инструкциям) представляют собой сжимаемую функцию над входными данными, и для них закон Денсинга действительно работает. Фактические знания несжимаемы - снизу их ограничивает энтропия Шеннона сохраняемых фактов. При этом обе задачи делят общий бюджет параметров. Таким образом, насыщение бенчмарков - это свидетельство того, что стандартные бенчмарки перестали измерять ту часть масштабирования, которую нельзя сжать, а вовсе не доказательство остановки самого масштабирования. См. factual-capacity-scaling.

3. Таблица оценок frontier-моделей

Обратив калибровочную кривую для 92 проприетарных моделей (ни одна из них не использовалась при подгонке кривой), Ли получает оценки эффективного размера вне выборки:

Model Vendor IKP Est. size 90% PI
GPT-5.5 OpenAI 71.9% ~9.7T [3.2–28.7T]
Claude Opus 4.6 Anthropic 68.0% ~5.3T [1.8–15.6T]
GPT-5 Pro OpenAI 66.5% ~4.1T [1.4–12.2T]
GPT-5 OpenAI 66.4% ~4.1T [1.4–12.1T]
Claude Opus 4.7 Anthropic 66.4% ~4.0T [1.4–12.0T]
o1 OpenAI 65.4% ~3.5T [1.2–10.3T]
Grok-4 xAI 64.8% ~3.2T [1.1–9.4T]
Claude Sonnet 4.6 Anthropic 60.9% ~1.7T [579B–5.1T]
Gemini 2.5 Pro Google 58.4% ~1.2T [387B–3.4T]
GPT-4o OpenAI 55.3% ~720B [241B–2.1T]
Qwen3-Max Alibaba 55.0% ~685B [229B–2.0T]
GPT-4 OpenAI 54.8% ~666B [223B–2.0T]
Gemini 2.5 Flash Google 47.4% ~207B [69B–617B]
Claude Haiku 4.5 Anthropic 39.9% ~65B [22B–194B]

Семейство Gemini 3.x исключено из таблицы frontier-моделей, поскольку Gemini 3.1 Pro служит опорной точкой калибровки для T6: по построению её точность на T6 равна 88%, что завышает показатели внутри семейства.

Выделяются четыре группы:

  • Вершина: GPT-5.5 в одиночку, в 1.4 раза выше ближайшей модели и в 2.4 раза выше основного кластера.
  • Frontier-кластер: GPT-5 / Opus 4.7 / o1 / Grok-4 / o3 / Opus 4.5 / 4.1 в диапазоне от 3.0 до 4.1T. Пять лет конкурентной разработки в четырёх лабораториях сошлись с разбросом эффективной ёмкости не более 1.4x.
  • Прошлые флагманы: GPT-4.1, Grok-3, GPT-5.4 Pro, ранние поколения Opus на уровне 2-3T.
  • Компактная и эффективная линейка: GPT-5 Mini 410B, Gemini 2.5 Flash 207B, GPT-5 Nano 71B, Claude Haiku 4.5 65B. Охватывает диапазон ёмкости в целый порядок. Соотношение между верхом и низом проприетарного парка (~150x) практически точно повторяет соотношение между самой большой и самой маленькой открытой моделью в калибровочной выборке.

Другие наблюдения

Тариф Pro почти не добавляет фактической ёмкости. Прирост эффективной ёмкости у GPT-5 Pro составляет 1.05x, а у GPT-5.5 Pro - 1.13x. Это согласуется с позиционированием разработчиков: Pro-версии дают преимущества в рассуждениях, агентных задачах и длинном контексте (сжимаемые процедурные навыки), а не новые сохранённые факты.

Точечные релизы GPT-5 -> 5.x - это переобучения с нуля, а не развитие одной ветки. Кластер 5.x (5, 5.1, 5.2, 5.3, 5.4) колеблется всего на ~8 п. п. около отметки 66% IKP. GPT-5.5 совершает скачок до 71.4%, заметно отрываясь от кластера. Анализ отпечатков (коэффициент Жаккара для редких фактов и сходство галлюцинаций) относит каждый переход 5 -> 5.x к режиму полного переобучения (сходство < 0.10). Похоже, OpenAI выпускает промежуточные релизы как заново обученные на других данных модели, а не как дообучение единой базы. Линейка Claude Opus 4 -> 4.1 -> 4.5 -> 4.6 -> 4.7 демонстрирует монотонный рост IKP (52.4 -> 65.7 п. п. на базе без thinking mode), что характерно для масштабирования по одной оси.

Режим размышлений (thinking mode) не создаёт новых знаний. По 27 парам базовая модель / thinking средний прирост составляет +2.2 п. п.; максимальная польза видна на T3-T4, а на T7 сходит на нет. Наибольший прирост зафиксирован у перехода Grok-4 -> 4.20-think (+10.3 п. п.). Claude Opus 4.7 в режиме thinking справляется с IKP хуже, чем без него (66.4 против 68.0). Интерпретация: цепочка рассуждений (chain-of-thought) помогает извлечению информации, но не увеличивает запас сохранённых фактов. Обновляет страницу thinking-mode-rule-erosion данными по IKP.

Различительная способность по уровням.

  • T1-T2 насыщаются примерно к 120B.
  • T3 (самый крутой наклон, 0.324/декаду) насыщается около ~1.2T и является самым информативным уровнем: корреляция с общей точностью ρ = 0.983.
  • T6 - рубеж, на котором проприетарные модели отрываются от потолка открытых весов: DeepSeek V4 Pro набирает 1.0%, а GPT-5.5 - 38.5%.
  • T7 представляет собой жёсткий потолок. Только Jamba-large (2.8%) и Grok-4 (1.0%) набирают больше 1%. Все остальные модели дают 0% в пределах статистического шума выборки. T7 задаёт планку сложности за пределами возможностей существующих моделей: структурно зонды T7 нацелены на частоту упоминаний ниже порога, который способны удержать современные обучающие корпуса.

Снятие отпечатков знаний

Сочетание пересечения по Жаккару на редких фактах со сходством галлюцинаций (частотой, с которой две модели выдают одинаковый неверный ответ на редкие факты) даёт инструмент без необходимости дообучения, позволяющий различать модели с общими весами, ветки пост-тренировки и полные переобучения внутри линеек закрытых вендоров. Самое интересное здесь в том, что ошибочные ответы на редких фактах служат более надёжным отпечатком, чем правильные: две модели, выучившие один и тот же ошибочный факт, почти наверняка обучались на общих данных.

Связи

  • mixture-of-experts - обновлена результатами по ёмкости общего и активного числа параметров
  • factual-capacity-scaling - самостоятельная концепция, выходящая за рамки этой статьи
  • thinking-mode-rule-erosion - обновлена доказательствами работы thinking mode из IKP
  • pine-ai - организация Bojie Li
  • deepseek - V4 Pro выступает потолком для моделей с открытыми весами на уровне T6
  • chatgpt-5-5-pro-mathematical-research - Гауэрс и др. о GPT-5.5 Pro; IKP независимо подтверждает, что версия 5.5 - это настоящий скачок масштабирования на фоне кластера точечных релизов 5.x