Зонды несжимаемого знания (IKP)
- title
- Зонды несжимаемого знания (IKP)
- type
- summary
- summary
- Бенчмарк IKP оценивает число параметров закрытых моделей по фактической ёмкости (R²=0.917), опровергает закон Денсинга и даёт GPT-5.5 ~9.7T параметров
- tags
- llm, scaling-laws, benchmarks, parameter-estimation
- created
- 2026-05-13
- updated
- 2026-05-13
- lang
- ru
- translation_of
- incompressible-knowledge-probes
- source_updated
- 2026-05-13
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Bojie Li (Pine AI, arXiv 2604.24827, 27 апреля 2026 года) создал инструмент, который оценивает число параметров закрытой LLM по тому, сколько фактов она знает. Логика простая: feed-forward-слои трансформера хранят примерно 2-4 бита фактологических ассоциаций на параметр (Allen-Zhu & Li 2025; Morris et al. 2025), поэтому для хранения F фактов требуется как минимум F, делённое на число бит на параметр, весов. Измерив F, получаем нижнюю границу числа параметров. Традиционный альтернативный подход - экономика инференса с оценкой размера по пропускной способности API и тарифам - даёт погрешность от 2 раз и выше из-за допущений об оборудовании, батчинге и стеке обслуживания. Оценка IKP внутренняя: ей нужен только доступ к API в режиме чёрного ящика.
Набор зондов
1400 вопросов, разделённых на семь уровней сложности (от T1 Universal -> до T7 Extreme), границы которых эмпирически откалиброваны по шести опорным открытым моделям: Qwen 2.5 0.5B / 7B -> Qwen 3 32B / 235B -> Kimi K2.5 -> Gemini 3.1 Pro. Зонд попадает на уровень k, если опорная модель T_k отвечает правильно, а T_{k-1} - нет. Немонотонные зонды (около 15%) отбрасываются.
Преобладают два семейства зондов. Wikidata даёт 557 зондов на атрибуты вроде года основания или столицы (T3-T7, выборка по квартилям просмотров в Wikipedia). DBLP/arXiv даёт 345 зондов об исследователях - "назовите основную область этого исследователя в CS и укажите одну статью, систему, организацию или соавтора, связанных с его работой". В T5-T7 преобладают исследователи с 10-50 цитированиями. Оставшиеся 97 зондов - ручной баланс для уровней T1-T4.
Оценка выставляется по шкале +1.0 / +0.5 / 0 / λ, где λ = -1.0 штрафует за уверенный блеф. Соотношение STRONG > WEAK > REFUSAL > WRONG по построению означает, что откалиброванная честная модель строго превосходит агрессивного блефующего при том же уровне знаний. Баллы по отдельным уровням могут уходить в минус; итоговый балл - невзвешенное среднее по семи уровням.
Калибровка
Аппроксимация A = α·log₁₀(N) + β на 89 моделях с открытыми весами в диапазоне от 135M до 1600B даёт R² = 0.917. Каждое 10-кратное увеличение числа параметров добавляет ~14.7 п. п. к точности IKP. Кросс-валидация с исключением по одному (leave-one-out): медианная ошибка 1.59x, 68.5% попадают в диапазон 2x, 87.6% - в 3x.
Три вывода, заслуживающих отдельных страниц
1. Объём знаний предсказывает общее число параметров MoE, а не активное
Для моделей Mixture-of-Experts регрессия IKP по общему числу параметров даёт R² = 0.79. По активным параметрам: R² = 0.51. Фактические знания распределены по весам всех экспертов, а не только тех, которые активируются на каждый токен. Это подтверждает давнее эмпирическое наблюдение сообщества, у которого раньше не было чёткого экспериментального подтверждения; см. mixture-of-experts, куда уже добавлен этот результат. Это согласуется с совместными законами масштабирования MoE из Ludziejewski et al. (2025) и единым масштабированием MoE из Clark et al. (2022).
2. Закон Денсинга неверен для сохранённых знаний
"Закон Денсинга" (Huang et al. 2025) утверждает, что полезная ёмкость на параметр удваивается каждые ~3.5 месяца. По 96 датированным моделям с открытыми весами с 2023-09-27 по 2026-04-24 IKP ложится в формулу:
pen_acc = β₀ + β₁·log₁₀(N_B) + β₂·months
β₂ = -0.0010/месяц (95% CI [-0.0031, +0.0008]) - неотличимо от нуля. Предсказание закона Денсинга в +0.0117/месяц отвергается при p < 10⁻¹⁵.
Здесь важна смена перспективы: процедурные способности (рассуждение, парсинг, следование инструкциям) представляют собой сжимаемую функцию над входными данными, и для них закон Денсинга действительно работает. Фактические знания несжимаемы - снизу их ограничивает энтропия Шеннона сохраняемых фактов. При этом обе задачи делят общий бюджет параметров. Таким образом, насыщение бенчмарков - это свидетельство того, что стандартные бенчмарки перестали измерять ту часть масштабирования, которую нельзя сжать, а вовсе не доказательство остановки самого масштабирования. См. factual-capacity-scaling.
3. Таблица оценок frontier-моделей
Обратив калибровочную кривую для 92 проприетарных моделей (ни одна из них не использовалась при подгонке кривой), Ли получает оценки эффективного размера вне выборки:
| Model | Vendor | IKP | Est. size | 90% PI |
|---|---|---|---|---|
| GPT-5.5 | OpenAI | 71.9% | ~9.7T | [3.2–28.7T] |
| Claude Opus 4.6 | Anthropic | 68.0% | ~5.3T | [1.8–15.6T] |
| GPT-5 Pro | OpenAI | 66.5% | ~4.1T | [1.4–12.2T] |
| GPT-5 | OpenAI | 66.4% | ~4.1T | [1.4–12.1T] |
| Claude Opus 4.7 | Anthropic | 66.4% | ~4.0T | [1.4–12.0T] |
| o1 | OpenAI | 65.4% | ~3.5T | [1.2–10.3T] |
| Grok-4 | xAI | 64.8% | ~3.2T | [1.1–9.4T] |
| Claude Sonnet 4.6 | Anthropic | 60.9% | ~1.7T | [579B–5.1T] |
| Gemini 2.5 Pro | 58.4% | ~1.2T | [387B–3.4T] | |
| GPT-4o | OpenAI | 55.3% | ~720B | [241B–2.1T] |
| Qwen3-Max | Alibaba | 55.0% | ~685B | [229B–2.0T] |
| GPT-4 | OpenAI | 54.8% | ~666B | [223B–2.0T] |
| Gemini 2.5 Flash | 47.4% | ~207B | [69B–617B] | |
| Claude Haiku 4.5 | Anthropic | 39.9% | ~65B | [22B–194B] |
Семейство Gemini 3.x исключено из таблицы frontier-моделей, поскольку Gemini 3.1 Pro служит опорной точкой калибровки для T6: по построению её точность на T6 равна 88%, что завышает показатели внутри семейства.
Выделяются четыре группы:
- Вершина: GPT-5.5 в одиночку, в 1.4 раза выше ближайшей модели и в 2.4 раза выше основного кластера.
- Frontier-кластер: GPT-5 / Opus 4.7 / o1 / Grok-4 / o3 / Opus 4.5 / 4.1 в диапазоне от 3.0 до 4.1T. Пять лет конкурентной разработки в четырёх лабораториях сошлись с разбросом эффективной ёмкости не более 1.4x.
- Прошлые флагманы: GPT-4.1, Grok-3, GPT-5.4 Pro, ранние поколения Opus на уровне 2-3T.
- Компактная и эффективная линейка: GPT-5 Mini 410B, Gemini 2.5 Flash 207B, GPT-5 Nano 71B, Claude Haiku 4.5 65B. Охватывает диапазон ёмкости в целый порядок. Соотношение между верхом и низом проприетарного парка (~150x) практически точно повторяет соотношение между самой большой и самой маленькой открытой моделью в калибровочной выборке.
Другие наблюдения
Тариф Pro почти не добавляет фактической ёмкости. Прирост эффективной ёмкости у GPT-5 Pro составляет 1.05x, а у GPT-5.5 Pro - 1.13x. Это согласуется с позиционированием разработчиков: Pro-версии дают преимущества в рассуждениях, агентных задачах и длинном контексте (сжимаемые процедурные навыки), а не новые сохранённые факты.
Точечные релизы GPT-5 -> 5.x - это переобучения с нуля, а не развитие одной ветки. Кластер 5.x (5, 5.1, 5.2, 5.3, 5.4) колеблется всего на ~8 п. п. около отметки 66% IKP. GPT-5.5 совершает скачок до 71.4%, заметно отрываясь от кластера. Анализ отпечатков (коэффициент Жаккара для редких фактов и сходство галлюцинаций) относит каждый переход 5 -> 5.x к режиму полного переобучения (сходство < 0.10). Похоже, OpenAI выпускает промежуточные релизы как заново обученные на других данных модели, а не как дообучение единой базы. Линейка Claude Opus 4 -> 4.1 -> 4.5 -> 4.6 -> 4.7 демонстрирует монотонный рост IKP (52.4 -> 65.7 п. п. на базе без thinking mode), что характерно для масштабирования по одной оси.
Режим размышлений (thinking mode) не создаёт новых знаний. По 27 парам базовая модель / thinking средний прирост составляет +2.2 п. п.; максимальная польза видна на T3-T4, а на T7 сходит на нет. Наибольший прирост зафиксирован у перехода Grok-4 -> 4.20-think (+10.3 п. п.). Claude Opus 4.7 в режиме thinking справляется с IKP хуже, чем без него (66.4 против 68.0). Интерпретация: цепочка рассуждений (chain-of-thought) помогает извлечению информации, но не увеличивает запас сохранённых фактов. Обновляет страницу thinking-mode-rule-erosion данными по IKP.
Различительная способность по уровням.
- T1-T2 насыщаются примерно к 120B.
- T3 (самый крутой наклон, 0.324/декаду) насыщается около ~1.2T и является самым информативным уровнем: корреляция с общей точностью ρ = 0.983.
- T6 - рубеж, на котором проприетарные модели отрываются от потолка открытых весов: DeepSeek V4 Pro набирает 1.0%, а GPT-5.5 - 38.5%.
- T7 представляет собой жёсткий потолок. Только Jamba-large (2.8%) и Grok-4 (1.0%) набирают больше 1%. Все остальные модели дают 0% в пределах статистического шума выборки. T7 задаёт планку сложности за пределами возможностей существующих моделей: структурно зонды T7 нацелены на частоту упоминаний ниже порога, который способны удержать современные обучающие корпуса.
Снятие отпечатков знаний
Сочетание пересечения по Жаккару на редких фактах со сходством галлюцинаций (частотой, с которой две модели выдают одинаковый неверный ответ на редкие факты) даёт инструмент без необходимости дообучения, позволяющий различать модели с общими весами, ветки пост-тренировки и полные переобучения внутри линеек закрытых вендоров. Самое интересное здесь в том, что ошибочные ответы на редких фактах служат более надёжным отпечатком, чем правильные: две модели, выучившие один и тот же ошибочный факт, почти наверняка обучались на общих данных.
Связи
- mixture-of-experts - обновлена результатами по ёмкости общего и активного числа параметров
- factual-capacity-scaling - самостоятельная концепция, выходящая за рамки этой статьи
- thinking-mode-rule-erosion - обновлена доказательствами работы thinking mode из IKP
- pine-ai - организация Bojie Li
- deepseek - V4 Pro выступает потолком для моделей с открытыми весами на уровне T6
- chatgpt-5-5-pro-mathematical-research - Гауэрс и др. о GPT-5.5 Pro; IKP независимо подтверждает, что версия 5.5 - это настоящий скачок масштабирования на фоне кластера точечных релизов 5.x