Вступление
Zonos v0.1 Transformer — это ведущая модель синтеза речи (Text-to-Speech) с открытым исходным кодом, разработанная компанией Zyphra. Она представляет собой чистую трансформерную архитектуру с 1.6 миллиарда параметров и является частью модельного семейства Zonos-v0.1, в которое также входит гибридная версия (SSM-трансформер). Официальный сайт: https://www.zyphra.com.
Модель обучена на более чем 200 000 часов разнообразной многоязычной речи и обеспечивает выразительность и качество, сопоставимые с ведущими проприетарными TTS-провайдерами, а в ряде случаев даже превосходящие их. Zonos позволяет генерировать естественную речь из текстовых подсказок на основе встраивания диктора или аудиопрефикса, а также точно клонировать голос по референсному аудиофрагменту длительностью всего в несколько секунд.
Модель распространяется под лицензией Apache 2.0, что разрешает как коммерческое, так и некоммерческое использование, и делает её доступной для широкого круга исследователей и разработчиков.
Технические характеристики
| Параметр | Значение |
|---|---|
| Архитектура | Чистый трансформер (Pure Transformer) |
| Количество параметров | 1.6 миллиарда (1.6B) |
| Размерность модели (d_model) | 2048 |
| Размерность промежуточного слоя (attn_mlp_d_intermediate) | 8192 |
| Архитектурный принцип | Нормализация текста и фонемизация через eSpeak → предсказание DAC-токенов |
| Выходная частота дискретизации | 44 кГц (нативная) |
| Поддерживаемые языки | Английский (американский и британский), японский, китайский, французский, немецкий |
| Минимальная длительность референсного аудио для клонирования | 5–30 секунд |
| Лицензия | Apache 2.0 |
| Пайплайн | text-to-speech |
| Библиотека | zonos |
Процесс работы модели:
- Входной текст нормализуется и преобразуется в фонемы с помощью eSpeak.
- Полученные фонемы подаются на вход трансформерной модели.
- Модель предсказывает DAC-токены (Discrete Audio Codec).
- Токены декодируются через автоэнкодер в финальный аудиосигнал с частотой 44 кГц.
Аппаратные требования и производительность:
- Реального времени фактор (RTF): ~2x на NVIDIA RTX 4090.
- Поддерживаемые ОС: Linux (предпочтительно Ubuntu 22.04/24.04).
- Требуемое оборудование: современные NVIDIA GPU (серии 3000 или новее).
- Поддерживаемые рантаймы: PyTorch, совместимость с Docker.
Дата выхода и доступность
- Официальная дата анонса: 10 февраля 2025 года.
- Дата публикации весов на Hugging Face: 12 февраля 2025.
- Модель доступна в открытых весах на Hugging Face, исходный код на GitHub, официальный API Zyphra (Python и TypeScript), интерактивный Playground, GGUF-формат, DeepInfra, OpenRouter, PyPI-пакет zyphra.
Ценообразование (API)
- Flat-rate pricing: $0.02 за минуту синтеза.
- Бесплатный уровень: 100 минут в месяц.
- Pro-тариф: 300 минут за $5 в месяц.
- Enterprise: индивидуальные условия.
- Дополнительно: безлимитное клонирование голоса, отсутствие ограничений на одновременные генерации.
Ключевые возможности
- Zero-shot клонирование голоса — достаточно 10–30 секунд референсного аудио.
- Аудиопрефиксы — добавление префикса для точного соответствия голосу, включая шёпот.
- Тонкая настройка темпа речи, вариации высоты тона, качества аудио и эмоций (счастье, гнев, печаль, страх).
- Многоязычная поддержка — 5 языков.
- Высокая производительность — RTF ~2x на RTX 4090.
- Gradio WebUI — готовый интерфейс для генерации без кода.
Заключение
Zonos v0.1 Transformer от Zyphra представляет собой значительный шаг вперёд в области открытых TTS-моделей. Сочетание 1.6 миллиарда параметров, обучения на 200 000+ часах многоязычной речи и лицензии Apache 2.0 делает её одним из самых мощных и доступных решений на рынке.
Модель обеспечивает высококачественное клонирование голоса с минимальным референсным аудио, гибкое управление эмоциями и параметрами речи, а также поддержку пяти языков. Производительность ~2x RTF на RTX 4090 и наличие готового Gradio-интерфейса делают её доступной как для исследователей, так и для коммерческих разработчиков.
Zonos уже интегрирована в экосистему Zyphra через официальный API с прозрачным ценообразованием ($0.02/минута), а также доступна через DeepInfra, OpenRouter и другие платформы. Релиз модели в феврале 2025 года ознаменовал собой важную веху в демократизации высококачественного синтеза речи, предоставив сообществу инструмент, способный конкурировать с лучшими проприетарными решениями.


