Zonos v0.1 Transformer: высококачественный TTS с открытым весом от Zyphra

Zonos v0.1 Transformer — это ведущая модель синтеза речи (Text-to-Speech) с открытым исходным кодом, разработанная компанией Zyphra. Она представляет собой чистую трансформерную архитектуру с 1.6 миллиарда параметров и является частью модельного семейства Zonos-v0.1, в которое также входит гибридная версия (SSM-трансформер).

Вступление

Zonos v0.1 Transformer — это ведущая модель синтеза речи (Text-to-Speech) с открытым исходным кодом, разработанная компанией Zyphra. Она представляет собой чистую трансформерную архитектуру с 1.6 миллиарда параметров и является частью модельного семейства Zonos-v0.1, в которое также входит гибридная версия (SSM-трансформер). Официальный сайт: https://www.zyphra.com.

Модель обучена на более чем 200 000 часов разнообразной многоязычной речи и обеспечивает выразительность и качество, сопоставимые с ведущими проприетарными TTS-провайдерами, а в ряде случаев даже превосходящие их. Zonos позволяет генерировать естественную речь из текстовых подсказок на основе встраивания диктора или аудиопрефикса, а также точно клонировать голос по референсному аудиофрагменту длительностью всего в несколько секунд.

Модель распространяется под лицензией Apache 2.0, что разрешает как коммерческое, так и некоммерческое использование, и делает её доступной для широкого круга исследователей и разработчиков.

Технические характеристики

Параметр Значение
Архитектура Чистый трансформер (Pure Transformer)
Количество параметров 1.6 миллиарда (1.6B)
Размерность модели (d_model) 2048
Размерность промежуточного слоя (attn_mlp_d_intermediate) 8192
Архитектурный принцип Нормализация текста и фонемизация через eSpeak → предсказание DAC-токенов
Выходная частота дискретизации 44 кГц (нативная)
Поддерживаемые языки Английский (американский и британский), японский, китайский, французский, немецкий
Минимальная длительность референсного аудио для клонирования 5–30 секунд
Лицензия Apache 2.0
Пайплайн text-to-speech
Библиотека zonos

Процесс работы модели:

  1. Входной текст нормализуется и преобразуется в фонемы с помощью eSpeak.
  2. Полученные фонемы подаются на вход трансформерной модели.
  3. Модель предсказывает DAC-токены (Discrete Audio Codec).
  4. Токены декодируются через автоэнкодер в финальный аудиосигнал с частотой 44 кГц.

Аппаратные требования и производительность:

  • Реального времени фактор (RTF): ~2x на NVIDIA RTX 4090.
  • Поддерживаемые ОС: Linux (предпочтительно Ubuntu 22.04/24.04).
  • Требуемое оборудование: современные NVIDIA GPU (серии 3000 или новее).
  • Поддерживаемые рантаймы: PyTorch, совместимость с Docker.

Дата выхода и доступность

  • Официальная дата анонса: 10 февраля 2025 года.
  • Дата публикации весов на Hugging Face: 12 февраля 2025.
  • Модель доступна в открытых весах на Hugging Face, исходный код на GitHub, официальный API Zyphra (Python и TypeScript), интерактивный Playground, GGUF-формат, DeepInfra, OpenRouter, PyPI-пакет zyphra.

Ценообразование (API)

  • Flat-rate pricing: $0.02 за минуту синтеза.
  • Бесплатный уровень: 100 минут в месяц.
  • Pro-тариф: 300 минут за $5 в месяц.
  • Enterprise: индивидуальные условия.
  • Дополнительно: безлимитное клонирование голоса, отсутствие ограничений на одновременные генерации.

Ключевые возможности

  • Zero-shot клонирование голоса — достаточно 10–30 секунд референсного аудио.
  • Аудиопрефиксы — добавление префикса для точного соответствия голосу, включая шёпот.
  • Тонкая настройка темпа речи, вариации высоты тона, качества аудио и эмоций (счастье, гнев, печаль, страх).
  • Многоязычная поддержка — 5 языков.
  • Высокая производительность — RTF ~2x на RTX 4090.
  • Gradio WebUI — готовый интерфейс для генерации без кода.

Заключение

Zonos v0.1 Transformer от Zyphra представляет собой значительный шаг вперёд в области открытых TTS-моделей. Сочетание 1.6 миллиарда параметров, обучения на 200 000+ часах многоязычной речи и лицензии Apache 2.0 делает её одним из самых мощных и доступных решений на рынке.

Модель обеспечивает высококачественное клонирование голоса с минимальным референсным аудио, гибкое управление эмоциями и параметрами речи, а также поддержку пяти языков. Производительность ~2x RTF на RTX 4090 и наличие готового Gradio-интерфейса делают её доступной как для исследователей, так и для коммерческих разработчиков.

Zonos уже интегрирована в экосистему Zyphra через официальный API с прозрачным ценообразованием ($0.02/минута), а также доступна через DeepInfra, OpenRouter и другие платформы. Релиз модели в феврале 2025 года ознаменовал собой важную веху в демократизации высококачественного синтеза речи, предоставив сообществу инструмент, способный конкурировать с лучшими проприетарными решениями.

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *