CrofAI
- title
- CrofAI
- type
- toolbox
- summary
- Дешёвый хостинг инференса открытых моделей, публикующий формат квантования для каждой из них
- tags
- llm, inference-provider, quantization, watchlist
- language
- hosted service
- license
- commercial (closed-source backend)
- created
- 2026-05-13
- updated
- 2026-07-29
- lang
- ru
- translation_of
- crofai
- source_updated
- 2026-07-29
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-medium
CrofAI (ai.nahcrof.com) - это провайдер хостинга инференса LLM, который позиционирует себя как "самый дешёвый провайдер инференса для больших моделей". Сервис предлагает каталог открытых моделей - DeepSeek V4, GLM 5 / 5.1, Kimi K2.5 / K2.6, Mimo V2.5, Qwen 3.5 / 3.6, Gemma 4, MiniMax M2.5 и модель под названием greg - через API, по виду совместимый с OpenAI (публичная страница с ценами была единственным документированным интерфейсом на момент ingest'а; запросы обрабатываются эндпоинтами с авторизацией). На фоне крупных провайдеров сервис выделяется тремя деталями:
- Раскрывается формат квантования. Для каждой модели в таблице указан формат весов:
Q4_0,Q4_K_M,Q6_K,Q8_0,int4,fp8,awq. Большинство крупных провайдеров скрывают эту информацию. CrofAI выносит её в отдельную колонку. См. llm-quantization, где объясняется разница между Q4_0, Q4_K_M и UD-Q4_K_XL. - Две непересекающиеся модели оплаты. Тариф Free - это чистый pay-as-you-go по указанным тарифам за токен ("Оплата только по факту использования. Без регулярной ежемесячной платы"). Платные тарифы ($5-$100/мес) представляют собой фиксированную подписку на ежедневную квоту запросов (500-15 000 запросов в день) без дополнительной платы за токены: тарифы за токен, судя по всему, являются ценой PAYG / овердрафта, а не дополнительным сбором сверх квоты. Некоторые "precision"-варианты списывают по 2 запроса из дневного лимита. На странице прямо не сказано, что происходит при превышении дневного лимита.
- Базовый уровень - Q4_0. Большинство моделей используют более агрессивное квантование
Q4_0вместоQ4_K_M. Это даёт ощутимо худшее качество на архитектурах MoE (см. llm-quantization). Варианты с повышенной точностью ("precision") -deepseek-v4-pro-precision,mimo-v2.5-pro-precision,glm-5.1-precision,kimi-k2.6-precision- переходят наQ8_0илиint4при цене в 2-3 раза выше.
Срез цен (2026-05-13)
| Model | Quant | Context | $/M in | $/M cache | $/M out | Speed |
|---|---|---|---|---|---|---|
| deepseek-v4-pro | Q4_0 | 1M | $0.40 | $0.003 | $0.85 | ~70 t/s |
| deepseek-v4-pro-precision | Q8_0 | 1M | $1.25 | $0.10 | $2.50 | ~73 t/s |
| deepseek-v4-flash | Q4_0 | 1M | $0.12 | $0.02 | $0.21 | ~77 t/s |
| kimi-k2.6 | Q3_K_L | 262k | $0.50 | $0.10 | $1.99 | ~82 t/s |
| kimi-k2.5-lightning | 530b-int4 | 131k | $1.00 | $0.20 | $3.00 | ~1890 t/s |
| glm-5.1 | Q6_K | 202k | $0.45 | $0.09 | $2.10 | ~171 t/s |
| qwen3.5-9b | fp8 | 262k | $0.04 | $0.008 | $0.15 | ~210 t/s |
| gemma-4-31b-it | Q4_0 | 262k | $0.10 | $0.02 | $0.30 | ~90 t/s |
Полная таблица находится на странице-источнике. Некоторые позиции помечены как vision (мультимодальный ввод изображений), BETA или 2x requests.
Показатель kimi-k2.5-lightning на уровне ~1890 t/s выделяется сильнее всего: это примерно в 10-25 раз выше пропускной способности аналогичных развёртываний Kimi K2 у других провайдеров. Почти наверняка здесь задействовано активное speculative-decoding или пакетная генерация черновых токенов (draft tokens). Цена ($1.00 / $3.00) отражает эту скоростную категорию.
Тарифы
| Plan | Price | Daily requests | Notes |
|---|---|---|---|
| Free / PAYG | $0/mo | - | Token billing only |
| Hobby | $5/mo | 500 | All models |
| Pro | $10/mo | 1,000 | + Priority support |
| Intermediate | $20/mo | 2,500 | |
| Scale | $50/mo | 7,500 | |
| Max | $100/mo | 15,000 |
Уровень подписки - это дневная квота запросов по фиксированной месячной цене. Это необычно для провайдера LLM API и ближе к модели ChatGPT в духе "$X/мес за N сообщений в день". PAYG существует параллельно как альтернатива с оплатой за токен. Предсказуемость расходов - явный плюс для сценариев с большим объёмом коротких промптов (чат-боты, классификация); для работы с длинным контекстом эта модель менее выгодна, так как каждый запрос расходует один слот квоты независимо от размера. Флаг 2x requests для вариантов "precision" используется как рычаг, чтобы тяжёлые вызовы не исчерпывали квоты младших тарифов. Чего страница не объясняет: действует ли тарификация за токены внутри квоты, что происходит при её превышении и отличаются ли цены за токен для подписчиков от тарифов PAYG.
Сравнение
CrofAI ближе к DeepInfra / Together / Fireworks (прямой хостинг открытых моделей), чем к routing.run / gomodel / claude-code-router (которые маршрутизируют запросы к другим провайдерам). Сервис не является агрегатором: в каталоге представлено только то, что физически крутится на серверах ai.nahcrof.com. Ближайший аналог по поведению и структуре - telnyx: каталог китайских открытых моделей на собственных GPU провайдера с указанием формата квантования прямо в названии модели (GLM-5.2-FP8).
Базовый уровень Q4_0 - это компромисс. Для задач написания кода агентами, где минимально приемлемым уровнем считается Q4_K_M (см. local-llm-16gb-vram-tests и habr-local-llm-quantization-deep-dive), Q4_0 может уступать по качеству официальному API DeepSeek при сопоставимой стоимости. При этом для экспериментов, мультимодальных задач или дешёвой пакетной обработки цены действительно низкие.
Ограничения и открытые вопросы
- Бэкенд с закрытым исходным кодом: квантование раскрыто, но детали маршрутизации, батчинга и работы с KV-cache неизвестны
- Эндпоинт
/pricing_apiтребует авторизации - публичные цены приходится собирать через браузерный скрейпинг - На промо-странице нет истории работы, отзывов клиентов или показателей доступности (uptime)
- Квантование Q4_0 на продакшен-моделях (особенно MoE) может выдавать качество ниже ожидаемого - см. llm-quantization
- Значения "Speed" отражают общую пропускную способность, а не задержку до первого токена (TTFT)
- Нет публичной документации по структуре API, авторизации и заголовкам rate-limit (ссылка "Documentation" со страницы цен требует входа в аккаунт)
- Работа в рамках одного домена (ai.nahcrof.com) - нет информации о команде, соответствия SOC2, политики конфиденциальности или SLA
Причина включения в watchlist
Страница добавлена в watchlist: небольшой провайдер без подтверждённой истории, агрессивное базовое квантование, работа на одном домене. Проверить через 90 дней: отзывы сторонних пользователей, регулярность обновлений каталога моделей, наличие жалоб на качество базовых версий Q4_0 и сохранение статуса "самого дешёвого" сервиса на фоне пересмотра цен в DeepInfra / Fireworks / Together.
Перекрёстные ссылки
- llm-quantization - почему разница между Q4_0 и Q4_K_M напрямую влияет на качество
- deepseek - три модели CrofAI относятся к линейке DeepSeek (V4 Pro, V4 Flash, V3.2)
- mixture-of-experts - большинство моделей в каталоге построены на MoE; чувствительность к квантованию у MoE выше
- speculative-decoding - вероятный механизм, обеспечивающий ~1890 t/s у kimi-k2.5-lightning
- routing.run - другой подход (маршрутизатор, а не хостинг)
- gomodel - шлюз поверх нескольких провайдеров
- claude-code-router - может использовать CrofAI в качестве одного из провайдеров
- crofai-pricing - срез исходных данных