EnglishРусский Map

LLM: интеллект против стоимости

title
LLM: интеллект против стоимости
type
summary
summary
Гвидо Империале перестроил график интеллект/стоимость от Artificial Analysis на линейной шкале с ценами OpenRouter и затратами на электричество
tags
llm, cost, benchmarks, open-weights, local-llm
created
2026-09-14
updated
2026-09-14
lang
ru
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Artificial Analysis публикует Intelligence Index - средний балл по фиксированному набору бенчмарков, прогоняемых на каждой модели, - и фиксирует, во сколько обходится каждый прогон. Поскольку набор бенчмарков для всех моделей одинаков, эти расходы служат относительной стоимостью задачи. Самый известный график компании сопоставляет одно с другим и строит границу Парето - самую дешёвую модель для каждого уровня интеллекта. Гвидо Империале, staff software engineer в OpenTeams и мейнтейнер Dask, утверждает, что этот график вводит в заблуждение, и перерисовывает его llm-intelligence-vs-cost.

Издатель материально заинтересован в таком выводе. В заголовке страницы OpenTeams указан её слоган - "AI you own", а сам пост заканчивается рекомендацией использовать дешёвые модели с открытыми весами и локальный inference. В публикации нет прямой рекламы, но именно к этому ведёт её вывод.

Три претензии

Первая - логарифмическая шкала стоимости. Именно лог-шкала позволяет читателю различить модель за $0.015 за задачу и модель за $0.032 на том же графике, где присутствует модель за $3.69, которая стоит примерно в 250 раз больше. Расплата за это в том, что читатель перестаёт видеть, насколько велик разрыв между дешёвыми и дорогими моделями и насколько мало значения имеет разница между дешёвыми.

Вторая претензия - Artificial Analysis оценивает каждую модель по ценам API её собственного разработчика. Для моделей с открытыми весами это может стоить гораздо дороже, чем аренда тех же весов у стороннего хостинга, а OpenRouter позволяет легко переключиться на самого дешёвого провайдера.

Третья - небольшие локальные модели показаны по ценам дата-центров, которые всегда невыгодны в пересчёте на полученный интеллект и которые никто не платит при запуске такой модели на собственном компьютере.

Перестроенный график

На его графиках сохранены оценки интеллекта от Artificial Analysis (при максимальном thinking effort, если не указано иное), а всё остальное изменено. Шкала стоимости - линейная, "потому что деньги людей не подчиняются логарифмам". Kimi K3, Qwen3.8 Max, DeepSeek V4 Flash 0731, GLM-5.3, GLM-5.3-Flash и Hy3 оцениваются по тарифам OpenRouter без учёта очень медленных или ненадёжных провайдеров, а также тех, у кого нет политики нулевого хранения данных (zero-data-retention). GLM-5.3-Flash при высоком effort экстраполирована объединением оценки максимального effort от Artificial Analysis с собственными оценками Z.ai по кодингу на других уровнях effort. Модели размером до 35 миллиардов параметров оцениваются по стоимости локальной электроэнергии. Ornith-1.5-35B-A3B добавлена по данным бенчмарков самих авторов, к которым, по его словам, стоит относиться с "здоровой долей скептицизма". Исходный график границы Парето от Artificial Analysis воспроизведён в deepseek-v4-flash-0731-artificial-analysis, а z-ai рассказывает о лаборатории, стоящей за GLM-5.3.

Он предлагает правило для чтения шкалы интеллекта: разницу в один балл вряд ли кто-то заметит, разрыв в пять баллов - существенный. Оценка 50, нижняя граница его графика для высокоинтеллектуальных моделей, - это примерно то, что выдавала лучшая модель в мире в феврале 2026 года, Opus 4.6. Сами графики представлены изображениями и в сохранённый текст не попали, поэтому отдельные точки, кроме процитированных ниже, невозможно проверить по первоисточнику.

Оценка стоимости локальной модели

Оценка по электричеству грубая, о чём прямо и говорится. Берём количество выходных токенов на задачу из Artificial Analysis, смотрим на скорость генерации (decode speed) на локальном железе (в основном RTX 3090 выпуска 2020 года, около $1400 на вторичном рынке), измеряем разницу между пиковым потреблением и потреблением в простое, считаем электричество по $0.2049/кВт*ч (средний тариф для жилых домов в США с поправкой на численность населения по состоянию на май 2026 года) и накидываем 15% на некэшированные входные токены и ожидание вызовов инструментов (tool calls). Оборудование считается бесплатным, исходя из логики, что ПК с RTX 3090 или 64 GB Strix Halo - это компьютер, который люди и так бы купили. Платформа почти не имеет значения: Strix Halo потребляет меньше энергии, чем 3090, но работает дольше.

Этот аргумент перестаёт работать при объёме памяти выше 64 GB, которую почти никто не покупает ни для чего, кроме ИИ. Для Qwen3.8-Flash нужен как минимум Strix Halo на 128 GB, который стоит $3600 против $2000 за модель на 64 GB и не даёт ничего, кроме возможности запускать модели класса ~120B. Его таблица требований для более крупных локальных моделей: 128 GB (Strix Halo за $3600, DGX Spark за $4300, Mac Studio M5 Max за $5100, MacBook Pro M5 Max за $7150) тянет Qwen3.8-Flash, а также GLM-5.3-Flash и DeepSeek-V4-Flash с деградацией интеллекта; 256 GB (два DGX Spark за $8700, Mac Studio M5 Ultra за $11300) тянет GLM-5.3-Flash и DeepSeek-V4-Flash полноценно; 512 GB (два M5 Ultra, $22600) тянет GLM-5.3; а для Kimi K3 требуется 2 TB - две системы TensTorrent Galaxy Blackhole за $320000.

Вывод

SOTA-модели от Anthropic и OpenAI, по его словам, слишком дороги даже для крупных корпораций, тогда как более дешёвые китайские модели могут обходиться примерно как тариф на мобильную связь. Отдача падает быстро. Fable 5.1 набирает 66 баллов при $3.69 за задачу. GLM-5.3 набирает 60 баллов при $0.49 - в 7.5 раз дешевле, и, по его мнению, большинство людей с трудом заметит разницу. GLM-5.3-Flash при высоком effort набирает 55 баллов при $0.023 - в 160 раз дешевле Fable; она заметно слабее в сложной работе вроде написания целого проекта с нуля за один прогон, но он называет её достаточной для 90% человеческих потребностей. Qwen3.8-27B набирает 52 балла, расходуя электричества на $0.015 на компьютере, который у геймера уже есть.

Что этот аргумент показывает, а что нет

Довод о логарифмической шкале касается восприятия, а не информации: соотношение 250x на логарифмической оси видно как расстояние, а линейная ось превращает его в денежный разрыв. Что из этого правильнее, зависит от вопроса: "во сколько мне это обойдётся" или "во сколько раз больше". Корректировка цен имеет больший вес, поскольку она смещает модели на границу Парето и за её пределы, а не просто перерисовывает график.

Чего эти графики показать не могут, так это тезиса о "90% того, что нужно людям", - это суждение без каких-либо измерений под ним. Стоимость задачи в бенчмарке также упускает из виду то, во сколько обходится неправильный ответ с учётом повторных попыток и проверки - о чём и говорит local-ai-is-not-opus: локальный Qwen хорошо справляется с ограниченными задачами и проседает на длинных горизонтах, и этот разрыв невидим в едином усреднённом индексе. Правило о шуме в один балл перекликается с llm-output-variance, а несколько наиболее важных для его выводов точек экстраполированы или взяты из самоотчётов разработчиков.

Денежные показатели важны для всех, кто платит за токен, - это корпоративная проблема, описанная в ai-token-budget-explosion. Переключение хостинга в стиле OpenRouter представляет собой паттерн llm-api-routing-layer. Более крупные локальные конфигурации связаны с moe-cpu-offload, kimi-k3 и deltafin, а qwen3-8-flash-next посвящена модели Qwen3.8-Flash класса ~120B, для которой его таблица железа отводит 128 GB.