EnglishРусский Map
Preferring Local OSS LLMs

Локальный ИИ - это не Opus

title
Локальный ИИ - это не Opus
type
summary
summary
Alex Ellis о том, почему тезис о близости локальной Qwen к Opus неверен, но настроенная модель всё равно полезна небольшому софтверному бизнесу
tags
llm, local-models, ai-coding, self-hosted
created
2026-07-21
updated
2026-09-14
lang
ru
translation_of
local-ai-is-not-opus
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Alex Ellis ведёт софтверный бизнес на собственные средства (OpenFaaS, SlicerVM, Actuated, Inlets - всё на Golang, вся инфраструктура self-hosted) и использует ИИ-инструменты для написания кода со времён автодополнения по Tab. Этот пост - взвешенный отчёт, а не горячий наброс: что локальная модель реально дала бизнесу, что ей до сих пор нельзя доверить и какие подтверждения стоят за обоими выводами. Его тезис узок и непопулярен: распространённое утверждение, будто локальная Qwen 27B достигает "почти уровня Opus", ошибочно, но хорошо настроенная локальная модель всё равно приносит реальную, чётко очерченную пользу. Она даёт приватность, фиксированные затраты и защиту от рисков зависимости от вендора. Подписку на передовые модели она не заменяет. Об авторе см. alex-ellis.

Ловушка бенчмарков

Утверждение о "почти уровне Opus" опирается на одно число: Qwen 3.6 27B набирает 77.2 на SWE-Bench Verified против 88.6 у Claude Opus 4.8, из чего делают вывод, будто локальные модели "отстают от SOTA всего на 12%", а шестилетний GPU позволяет отказаться от подписки за $200 в месяц. Здесь две проблемы. SWE-Bench собран из задач на Python, а Python преимущественно однопоточен и синхронен; команда же Ellis'а пишет распределённый Go, где каналы, контексты и структуры охватывают большой домен исполнения, чего бенчмарк вообще не проверяет. К тому же бенчмарки публичны, поэтому небольшие модели специально натаскивают на высокие результаты: погоня за метриками раздувает ровно то число, на котором держится весь тезис. Передовые модели оцениваются в 0.5-2T параметров; dense-модель на 27B находится на совсем другом уровне независимо от позиций в одной таблице лидеров. В evaluating-quantized-models та же ловушка описана уровнем ниже, где вместо таблицы лидеров суррогатом выступает метрика квантования: KLD и bits per weight отсеивают откровенно сломанные варианты, а затем неверно ранжируют всё оставшееся, поскольку ни одна из них не оценивает целевой сценарий развёртывания.

"Локальные модели - это не про экономию" - позиция привилегированных

Распространённый тезис о том, что локальные модели "выбирают не ради экономии", исходит из допущения, будто у вас всегда есть доступ к субсидированному тарифу за $200 в месяц. Ellis указывает, где именно эти субсидии начинают давать сбой: GitHub Copilot стартовал с 1500 запросов за $39 в месяц, а затем тихо перевёл всех на оплату за токены, вызвав волну возмущения. Uber ограничил расходы на ИИ потолком в $1500 в месяц на разработчика за один инструмент: при медианной зарплате в $330k два инструмента с максимальным лимитом составляют примерно 12% от годового дохода. Субсидии реальны сегодня, но не гарантированы завтра. О сопутствующей экономике: ai-subsidy-economics, no-silver-bullet-llms.

Настоящая причина: суверенитет и вендорные риски

Что действительно подталкивает ориентированный на приватность бизнес к локальным моделям, так это контроль над данными и риски зависимости от вендоров. Ellis отмечает, что Fable 5 за одну ночь отключили для пользователей за пределами США: локальные модели - это ответ на вопрос "а что, если лаборатории передовых моделей сделают X?". Кроме того, клиентские данные по закону и контрактам вообще нельзя прогонять через облачные тарифы: отправка дампа телеметрии или диагностического снимка клиента в ChatGPT Pro или Claude Max, даже с настройкой хранения в 30 дней, скорее всего, нарушает соглашения с заказчиками. Поэтому они написали diag (CLI для создания снимка инсталляции OpenFaaS), просят операторов присылать дамп по почте и прогоняют его через изолированную локальную модель в эфемерной SlicerVM. При одном из аудитов базы телеметрии перед продлением подписки выяснилось, что клиент более года занижал число используемых лицензий и недоплачивал в 4-5 раз. Возврат этой выручки окупил оборудование - и этот анализ никогда бы не удалось провести через облачный тариф.

Ставка на железо

Ellis потратил около $12 000 на RTX 6000 Pro Blackwell с 96GB VRAM (через пару месяцев цена выросла примерно до $15 400). Карта окупилась, но за счёт сценариев поддержки и возврата упущенной выручки, а не за счёт отказа от Claude. Ранее он использовал связку из двух 3090, что было постоянным источником проблем: модель на 27B без квантования не помещается на одну 3090, вынуждая идти на компромиссы между квантованием весов, длиной контекста и сжатием KV-кэша (эмпирическое правило: проблемы начинаются при Q4_0 на ключах; его наиболее агрессивной конфигурацией были ключи Q8_0 и значения Q4_0). Даже с NVLink и tensor parallelism vLLM на генерации работала на 3 tok/s медленнее, чем llama.cpp: vLLM выигрывает при параллельной нагрузке в проде, но для рабочей станции одного пользователя время запуска и задержка важнее суммарной пропускной способности. См. llm-quantization, local-llm-16gb-vram-tests.

Где модель даёт сбой: длительные автономные задачи

Метафора клинка: при термообработке стали, если промахнуться с цветом побежалости хотя бы на оттенок, всё приходится начинать заново. Локальная модель "перегревается", проскакивает цель и зацикливается, и исправить это можно только перезапуском обвязки в надежде, что очищенный контекст даст другой результат. Конкретные сбои: когда её спросили, какие команды добавить в faas-cli, она выдала разумные предложения, а затем повторяла их полчаса, сжигая 600W; на просьбу написать reverse proxy на Python она ошиблась с отступами, попыталась исправить, повредила файл и окончательно запуталась; прочитала 27.3K как 273 000; сделала вывод, что клиент уйдёт из-за малого числа функций, упустив, что эти функции вызывались помногу раз в день. Вывод: локальные модели годятся для анализа, а не для интерпретации, и категорически не подходят для длительных задач без присмотра. В Claude и Codex поражает именно то, как долго они могут работать полностью автономно, добиваясь реального прогресса - в этом и заключается разрыв, а не в бенчмарках. Та же закономерность видна в constraint-decay и в аргументе о медианных задачах в no-silver-bullet-llms.

Рабочая конфигурация

Два независимых экземпляра llama.cpp на RTX 6000, каждый с полным контекстом в 262144 токена: базовая Qwen 3.6 27B и Qwopus (fine-tune, накладывающий цепочки рассуждений на Qwen для улучшения логики и написания кода). Спекулятивное декодирование через MTP даёт ~93% подтверждения драфт-токенов, поднимая устойчивую скорость со стабильных 67 tok/s до 130-200 tok/s - по ощущениям это быстрее облачной модели. Поскольку два агента на одном экземпляре инвалидируют кэшированный префикс друг друга (весь промпт обрабатывается заново каждый раз), совместное использование машины превращается в эксплуатационную задачу: идентификация, контроль доступа, учёт использования, квоты, маршрутизация, мониторинг энергопотребления. Ellis написал Toilgate - провайдер opencode для доступа и биллинга, сделанный в режиме vibe-coding, - и поставил две розетки Shelly Plus Plug для контроля питания (RTX 6000 потребляет 600W при инференсе; две 3090 берут суммарно ~750W и сильно шумят). См. speculative-decoding.

Ловушка, в которую легко попасть после наладки учёта, - сравнивать стоимость миллиона токенов с ценами API GPT-5.5. Это неверное сравнение, потому что ценность решения никогда не измерялась ценой за токен.

Где локальная модель действительно себя оправдывает

  • Чтение и объяснение кодовых баз, даже тех, код для которых она сама написать не способна - Ellis называет это суперсилой.
  • Чётко ограниченные задачи по поддержке под управлением детального AGENTS.md: в репозитории alexellis/arkade локальная модель добавляла новые CLI быстрее контрибьюторов-людей и сама тестировала свою работу.
  • Изолированная техподдержка клиентов и анализ там, где данные не могут покидать пределы инфраструктуры.
  • Соблюдение рекомендаций из карточки модели: температура, контекст и квантование имеют решающее значение, а слишком сильное квантование приводит к деградации.
  • Практика прогона одной и той же задачи и через локальную, и через облачную модель.

Модели на 70B Ellis пропускает (большинство из них отстают на поколения) и отмечает, что вариант Qwen 35-A3B популярен главным образом потому, что 3B активных параметров быстро работают на MacBook. Более крупным моделям (GLM 5.2, Kimi 2.7, Minimax M3, Deepseek V4 Flash) требуется 4-6 таких карт даже просто для загрузки квантованной копии. Его категоричный вывод: современные dense-модели на 27B не приспособлены к тому, чтобы писать на Go целыми днями; незатейливый Grok Coder Fast 1 обходился дешевле, работал быстрее и отлично служил команде месяцами до закрытия.

Ссылки

  • titit-local-ai - параллельный аргумент Ted'а Neward'а в пользу локального ИИ в малом бизнесе
  • lucumr-local-models - Armin Ronacher о том, почему разрыв в UX локальных моделей связан с доводкой продукта, а не с качеством самих моделей
  • local-llm-16gb-vram-tests - те самые ручки настройки квантования и KV-кэша, которые описывает Ellis, опробованные на потребительском железе
  • speculative-decoding - механизм драфта через MTP, обеспечивающий скорость 130-200 tok/s
  • llm-quantization - компромиссы при квантовании весов и KV-кэша
  • no-silver-bullet-llms - качество моделей деградирует при удалении от задокументированной медианы; тот же вывод на других примерах
  • constraint-decay - измеренная версия тезиса о сбоях на ограниченных задачах с жёсткими конвенциями
  • alex-ellis - автор
  • intelligence-vs-cost-linear - контраргумент с упором на цену: Guido Imperiale называет GLM-5.3-Flash по цене $0.023 за задачу бенчмарка достаточной для 90% потребностей пользователей - оценка, которую его графики не способны измерить и которая игнорирует разрыв на длительных задачах, описанный Ellis'ом
  • how-far-behind-are-open-models - замеренная версия ловушки бенчмарков: Håvard Tveit Ihle показывает, что открытые модели отстают на 4-6 месяцев на публичных бенчмарках и на 8-10 на приватных
  • deltafin - крайний противоположный случай: передовая открытая модель действительно работает дома, но со скоростью 14.6 секунды на токен
  • petals - тот же потолок пропускной способности, достигнутый с другой стороны: объединение чужих GPU для получения недоступных мощностей, где Llama 2 70B всё равно выдаёт около 6 tok/s
  • hartos - тот же стек в готовой упаковке (llama.cpp, GGUF, ярусное размещение), но под соусом гораздо более масштабных заявлений о том, что он делает ненужным
  • local-llm-guide - противоположный взгляд на уровне железа, о котором Ellis даже не спорит: jamesob подкрепляет утверждение о том, что локальные модели "почти догнали Opus", оборудованием примерно на $40k. Это не прямое противоречие, поскольку Ellis говорит о потребительском и prosumer-сегменте, но хранилищу не стоит считать вопрос о "близости к Opus" окончательно решённым в какую-либо сторону