EnglishРусский Map

Kokoro

title
Kokoro
type
toolbox
summary
TTS-модель на 82M параметров, быстро работающая на CPU: около 50 голосов на трёх языках
tags
text-to-speech, local-ai, model
language
Python
license
Apache-2.0
created
2026-07-18
updated
2026-07-18
lang
ru
translation_of
kokoro
source_updated
2026-07-18
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-medium

Kokoro - это модель синтеза речи (text-to-speech) на 82M параметров, выдающая естественное звучание на CPU. Несмотря на скромный размер, она поддерживает английский, севернокитайский (мандарин) и хинди и поставляется примерно с 50 голосами (в основном на английском). Веса и голоса выложены на Hugging Face как hexgrad/Kokoro-82M; репозиторий hexgrad/kokoro - это Python-библиотека для инференса. В руководстве Арии Хидаята (Ariya Hidayat) описан самый быстрый способ её запустить.

Чем она интересна

Она работает достаточно быстро на старом железе без GPU, чтобы быть практичной. Замеры Хидаята для короткого абзаца с голосом am_eric (лучший результат из трёх запусков): 12-летний Intel Core i7-4770K справился за 4,7 секунды, Apple M2 Pro - за 4,5, а AMD Ryzen 7 8745HS - за 1,5. Это оставляет GPU свободным для инференса LLM: свяжите Kokoro на CPU с локальной моделью на GPU, и ответы можно будет слушать, а не читать. Это тот же local-first аргумент, который titit-local-ai приводит для LLM, только применительно к речи, и TTS-аналог локального распознавания речи Whisper в ghost-pepper.

Запуск

Проще всего использовать готовый контейнер Kokoro-FastAPI, куда уже встроены модели голосов (поэтому образ весит около 5 GB):

podman run -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-cpu

Он поднимает веб-интерфейс на localhost:8880/web для быстрой проверки и - что полезнее - HTTP-интерфейс, совместимый с OpenAI speech API, так что существующий код для OpenAI-TTS работает с ним, если перенаправить базовый URL на локальный. Голос выбирается переменной окружения TTS_VOICE (например, am_eric); полный список приведён в VOICES.md модели.

Если нужен стек, который умеет ещё и переводить речь в текст (STT), есть Speaches - ещё один OpenAI-совместимый контейнер, добавляющий Whisper STT рядом с TTS. В отличие от Kokoro-FastAPI, он не включает в себя веса голосов заранее (их нужно скачивать через его API), зато представляет собой единый сервис для обоих направлений.

Ограничения

Слабое место модели - короткие реплики. Если попросить её произнести отдельное слово, например "six", Kokoro часто добавляет лишние звуки ("ah-six-ah"); причина в малом размере модели. Практический обходной путь - скормить ей полное предложение ("The word is: six"), а затем обрезать аудио по пословным временным меткам, которые возвращает API: это надёжно, хоть интонация и получается несколько плоской. Пользователи также отмечают, что мужские голоса уступают по качеству лучшим женским, а возможности SSML и тонкой настройки интонаций ограничены. Для омографов поддерживаются встроенные подсказки произношения в формате IPA, что решает большинство проблем с неверным чтением.

Набор языков в Kokoro фиксирован; для неподдерживаемых языков (например, нидерландского) придётся вернуться к более крупным и медленным моделям. Тем, кому нужно клонирование голоса или более тонкое управление эмоциями, чаще выбирают другие компактные модели - Pocket TTS, Supertonic, Chatterbox, - но для простого, быстрого и приватного озвучивания Kokoro остаётся стандартным выбором по умолчанию, и модель уже широко портировали (WASM/WebGPU в браузере, CoreML и Apple Neural Engine, ONNX).

8030 звёзд, лицензия Apache-2.0. Репозиторий: https://github.com/hexgrad/kokoro