EnglishРусский Map

CrofAI

Toolbox toolboxllminference-providerquantizationwatchlisthosted servicecommercial (closed-source backend) ↳ show in map Markdown
title
CrofAI
type
toolbox
summary
Дешёвый хостинг инференса открытых моделей, публикующий формат квантования для каждой из них
tags
llm, inference-provider, quantization, watchlist
language
hosted service
license
commercial (closed-source backend)
created
2026-05-13
updated
2026-07-29
lang
ru
translation_of
crofai
source_updated
2026-07-29
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-medium

CrofAI (ai.nahcrof.com) - это провайдер хостинга инференса LLM, который позиционирует себя как "самый дешёвый провайдер инференса для больших моделей". Сервис предлагает каталог открытых моделей - DeepSeek V4, GLM 5 / 5.1, Kimi K2.5 / K2.6, Mimo V2.5, Qwen 3.5 / 3.6, Gemma 4, MiniMax M2.5 и модель под названием greg - через API, по виду совместимый с OpenAI (публичная страница с ценами была единственным документированным интерфейсом на момент ingest'а; запросы обрабатываются эндпоинтами с авторизацией). На фоне крупных провайдеров сервис выделяется тремя деталями:

  1. Раскрывается формат квантования. Для каждой модели в таблице указан формат весов: Q4_0, Q4_K_M, Q6_K, Q8_0, int4, fp8, awq. Большинство крупных провайдеров скрывают эту информацию. CrofAI выносит её в отдельную колонку. См. llm-quantization, где объясняется разница между Q4_0, Q4_K_M и UD-Q4_K_XL.
  2. Две непересекающиеся модели оплаты. Тариф Free - это чистый pay-as-you-go по указанным тарифам за токен ("Оплата только по факту использования. Без регулярной ежемесячной платы"). Платные тарифы ($5-$100/мес) представляют собой фиксированную подписку на ежедневную квоту запросов (500-15 000 запросов в день) без дополнительной платы за токены: тарифы за токен, судя по всему, являются ценой PAYG / овердрафта, а не дополнительным сбором сверх квоты. Некоторые "precision"-варианты списывают по 2 запроса из дневного лимита. На странице прямо не сказано, что происходит при превышении дневного лимита.
  3. Базовый уровень - Q4_0. Большинство моделей используют более агрессивное квантование Q4_0 вместо Q4_K_M. Это даёт ощутимо худшее качество на архитектурах MoE (см. llm-quantization). Варианты с повышенной точностью ("precision") - deepseek-v4-pro-precision, mimo-v2.5-pro-precision, glm-5.1-precision, kimi-k2.6-precision - переходят на Q8_0 или int4 при цене в 2-3 раза выше.

Срез цен (2026-05-13)

Model Quant Context $/M in $/M cache $/M out Speed
deepseek-v4-pro Q4_0 1M $0.40 $0.003 $0.85 ~70 t/s
deepseek-v4-pro-precision Q8_0 1M $1.25 $0.10 $2.50 ~73 t/s
deepseek-v4-flash Q4_0 1M $0.12 $0.02 $0.21 ~77 t/s
kimi-k2.6 Q3_K_L 262k $0.50 $0.10 $1.99 ~82 t/s
kimi-k2.5-lightning 530b-int4 131k $1.00 $0.20 $3.00 ~1890 t/s
glm-5.1 Q6_K 202k $0.45 $0.09 $2.10 ~171 t/s
qwen3.5-9b fp8 262k $0.04 $0.008 $0.15 ~210 t/s
gemma-4-31b-it Q4_0 262k $0.10 $0.02 $0.30 ~90 t/s

Полная таблица находится на странице-источнике. Некоторые позиции помечены как vision (мультимодальный ввод изображений), BETA или 2x requests.

Показатель kimi-k2.5-lightning на уровне ~1890 t/s выделяется сильнее всего: это примерно в 10-25 раз выше пропускной способности аналогичных развёртываний Kimi K2 у других провайдеров. Почти наверняка здесь задействовано активное speculative-decoding или пакетная генерация черновых токенов (draft tokens). Цена ($1.00 / $3.00) отражает эту скоростную категорию.

Тарифы

Plan Price Daily requests Notes
Free / PAYG $0/mo - Token billing only
Hobby $5/mo 500 All models
Pro $10/mo 1,000 + Priority support
Intermediate $20/mo 2,500
Scale $50/mo 7,500
Max $100/mo 15,000

Уровень подписки - это дневная квота запросов по фиксированной месячной цене. Это необычно для провайдера LLM API и ближе к модели ChatGPT в духе "$X/мес за N сообщений в день". PAYG существует параллельно как альтернатива с оплатой за токен. Предсказуемость расходов - явный плюс для сценариев с большим объёмом коротких промптов (чат-боты, классификация); для работы с длинным контекстом эта модель менее выгодна, так как каждый запрос расходует один слот квоты независимо от размера. Флаг 2x requests для вариантов "precision" используется как рычаг, чтобы тяжёлые вызовы не исчерпывали квоты младших тарифов. Чего страница не объясняет: действует ли тарификация за токены внутри квоты, что происходит при её превышении и отличаются ли цены за токен для подписчиков от тарифов PAYG.

Сравнение

CrofAI ближе к DeepInfra / Together / Fireworks (прямой хостинг открытых моделей), чем к routing.run / gomodel / claude-code-router (которые маршрутизируют запросы к другим провайдерам). Сервис не является агрегатором: в каталоге представлено только то, что физически крутится на серверах ai.nahcrof.com. Ближайший аналог по поведению и структуре - telnyx: каталог китайских открытых моделей на собственных GPU провайдера с указанием формата квантования прямо в названии модели (GLM-5.2-FP8).

Базовый уровень Q4_0 - это компромисс. Для задач написания кода агентами, где минимально приемлемым уровнем считается Q4_K_M (см. local-llm-16gb-vram-tests и habr-local-llm-quantization-deep-dive), Q4_0 может уступать по качеству официальному API DeepSeek при сопоставимой стоимости. При этом для экспериментов, мультимодальных задач или дешёвой пакетной обработки цены действительно низкие.

Ограничения и открытые вопросы

  • Бэкенд с закрытым исходным кодом: квантование раскрыто, но детали маршрутизации, батчинга и работы с KV-cache неизвестны
  • Эндпоинт /pricing_api требует авторизации - публичные цены приходится собирать через браузерный скрейпинг
  • На промо-странице нет истории работы, отзывов клиентов или показателей доступности (uptime)
  • Квантование Q4_0 на продакшен-моделях (особенно MoE) может выдавать качество ниже ожидаемого - см. llm-quantization
  • Значения "Speed" отражают общую пропускную способность, а не задержку до первого токена (TTFT)
  • Нет публичной документации по структуре API, авторизации и заголовкам rate-limit (ссылка "Documentation" со страницы цен требует входа в аккаунт)
  • Работа в рамках одного домена (ai.nahcrof.com) - нет информации о команде, соответствия SOC2, политики конфиденциальности или SLA

Причина включения в watchlist

Страница добавлена в watchlist: небольшой провайдер без подтверждённой истории, агрессивное базовое квантование, работа на одном домене. Проверить через 90 дней: отзывы сторонних пользователей, регулярность обновлений каталога моделей, наличие жалоб на качество базовых версий Q4_0 и сохранение статуса "самого дешёвого" сервиса на фоне пересмотра цен в DeepInfra / Fireworks / Together.

Перекрёстные ссылки

  • llm-quantization - почему разница между Q4_0 и Q4_K_M напрямую влияет на качество
  • deepseek - три модели CrofAI относятся к линейке DeepSeek (V4 Pro, V4 Flash, V3.2)
  • mixture-of-experts - большинство моделей в каталоге построены на MoE; чувствительность к квантованию у MoE выше
  • speculative-decoding - вероятный механизм, обеспечивающий ~1890 t/s у kimi-k2.5-lightning
  • routing.run - другой подход (маршрутизатор, а не хостинг)
  • gomodel - шлюз поверх нескольких провайдеров
  • claude-code-router - может использовать CrofAI в качестве одного из провайдеров
  • crofai-pricing - срез исходных данных