Telnyx Inference
- title
- Telnyx Inference
- type
- entity
- summary
- Провайдер инференса, запускающий open-weight модели на собственных GPU через OpenAI-совместимый API
- aliases
- Telnyx Inference API
- tags
- llm, inference-provider, open-weights, hosted
- sources
- telnyx-inference
- created
- 2026-07-29
- updated
- 2026-09-14
- lang
- ru
- translation_of
- telnyx
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Telnyx Inference - это хостинговый API для open-weight моделей, работающий на GPU-инфраструктуре, которой Telnyx, по её утверждению, владеет, а не арендует. Интерфейс совместим с OpenAI, поэтому его можно подставить везде, где переопределяется базовый URL. Всё на этой странице взято из официального анонса Telnyx о появлении kimi-k3 на платформе от 2026-07-28 - документа вендора, к которому и относиться стоит соответственно.
Каталог
Telnyx указывает K3 (ID модели moonshotai/Kimi-K3) наряду с Kimi K2.6, GLM-5.2-FP8 и MiniMax M3. Это каталог китайских open-weight моделей без каких-либо западных frontier-моделей - ровно такой же состав предлагает и crofai. При этом GLM-5.2-FP8 выдаёт ту же деталь: ID модели раскрывает используемую для раздачи квантизацию. Большинство провайдеров не выносят это в название, а это важно: то, что отдаёт хостинговый эндпоинт, зависит не только от опубликованной модели, но и от того, как именно веса были сжаты для раздачи. В llm-quantization разобрано, почему формат квантизации важен так же, как и разрядность. GLM-5.2 - это модель от z-ai, а в glm-5-2-step-change-for-open-agents объясняется, почему она стала первой open-weight моделью, пригодной на роль универсального агента для написания кода.
Что Telnyx заявляет о K3 на своей платформе
В анонсе заявлено контекстное окно на 1M токенов, а целевыми сценариями названы анализ кодовых баз, обработка длинных документов и многошаговые агентские сессии; при этом "стабильная работа на длинном контексте" декларируется, а не подтверждается замерами. Нативная поддержка мультимодальности (native vision) - текст, изображения и видео принимаются одной и той же моделью без отдельного vision-адаптера. Настраиваемая глубина рассуждений (reasoning effort) на трёх уровнях (low, high и max), позволяющая разменивать вычисления на глубину цепочки рассуждений в каждом запросе. Вызов инструментов и структурированный вывод, включая function calling, динамическую загрузку инструментов и генерацию по JSON-схеме; обещание работы со структурированным выводом через constrained decoding стоит проверять самостоятельно: structured-output-benchmark показал разрыв в 15-30 пунктов между генерацией синтаксически валидного JSON и выдачей корректных значений на всех протестированных frontier-моделях. А также кэширование промптов по умолчанию - автоматическое кэширование префиксов при повторных запросах, из-за чего в тарифной сетке и появилась строка для кэшированного ввода.
Тарифы
| Token type | Price per 1M tokens |
|---|---|
| Cached input | $0.27 |
| Input | $2.70 |
| Output | $13.50 |
Кэшированный ввод стоит ровно в десять раз дешевле обычного, а вывод - в 5 раз дороже обычного ввода. При включённом по умолчанию кэшировании агентский цикл со стабильным системным промптом и схемой инструментов оплачивает большую часть префикса по тарифу $0.27 - именно поэтому в тарифной сетке три уровня цен, а не одна фиксированная цена за ввод.
Позиционирование и маркетинг
В разделе "почему это важно" утверждается, что "конкурентное преимущество в ИИ смещается от тех, кто создаёт самые умные модели, к тем, кто строит инфраструктуру, определяющую, где исполняется каждый запрос", - тезис, в продвижении которого провайдер инференса прямо заинтересован. Также заявляется, что K3 "конкурирует с закрытыми frontier-моделями от Anthropic и OpenAI" в задачах написания кода, рассуждений и агентской работы со знаниями, но без упоминания конкретных бенчмарков или цифр.
Ещё две неточности: Telnyx называет K3 "первой в мире open-source моделью в классе 3 триллионов параметров". Здесь 2.8T округляются до класса 3T, а термин "open-source" используется там, где точнее было бы сказать "open-weight" - Moonshot опубликовала веса и код архитектуры под собственной лицензией, а не исходный код под лицензией, одобренной OSI. Разбор архитектуры от Sebastian Raschka в kimi-k3 подтверждает суть (K3 с большим отрывом остаётся крупнейшей open-weight моделью), но обходится без округления.
Варианты запуска
Для тех, кто выбирает, где запускать K3, в первые дни после публикации весов было доступно три варианта: арендованный эндпоинт здесь, управляемый эндпоинт в Modal (тот самый, о котором упоминается в rl-finetune-beats-frontier) или deltafin на собственном железе со скоростью 14.6 секунды на токен. Именно совместимость с OpenAI API делает эти варианты взаимозаменяемыми - на это же свойство опирается и cc-mirror, чтобы перенаправлять Claude Code на альтернативных провайдеров.