Sesame CSM-1B: открытая модель синтеза речи

Sesame CSM-1B (Conversational Speech Model) — это инновационная модель генерации речи, разработанная компанией Sesame AI Labs. Модель стала широко известна как технологическая основа виртуального ассистента Maya — первого голосового ИИ, который, по мнению многих экспертов, преодолел «зловещую долину» (uncanny valley) в синтезе разговорной речи.

Sesame CSM-1B (Conversational Speech Model) — это инновационная модель генерации речи, разработанная компанией Sesame AI Labs. Модель стала широко известна как технологическая основа виртуального ассистента Maya — первого голосового ИИ, который, по мнению многих экспертов, преодолел «зловещую долину» (uncanny valley) в синтезе разговорной речи. Официальный сайт: https://www.sesame.com.

В отличие от традиционных TTS-систем, которые просто озвучивают текст, CSM-1B является мультимодальной моделью, работающей на уровне дискретных аудиокодеков. Модель принимает на вход как текст, так и аудио, и генерирует RVQ-аудиокоды, которые затем декодируются в естественную человеческую речь. Такой подход позволяет модели не только синтезировать речь, но и учитывать аудиоконтекст — например, сохранять тембр, интонацию и эмоциональную окраску голоса на основе короткого аудиопримера.

Ключевая философия Sesame при создании CSM-1B — сделать голосовой ИИ живым и естественным. Ассистенты Maya и Miles демонстрируют человеческие паттерны речи: паузы, дыхание, речевые сбои и возможность быть прерванными во время разговора — подобно тому, как это реализовано в голосовом режиме OpenAI. Модель распространяется по открытой лицензии Apache 2.0, что позволяет использовать её в коммерческих проектах с минимальными ограничениями. Вес модели доступен для скачивания на Hugging Face, а код — в репозитории SesameAILabs/csm на GitHub.

Архитектура и принцип работы

Sesame CSM-1B построена на гибридной архитектуре, сочетающей основной блок (backbone) на основе модели Llama от Meta и небольшой аудиодекодер, который производит Mimi-аудиокоды. Mimi — это предобученная кодек-модель, разработанная компанией Kyutai, которая кодирует речь в дискретные токены и декодирует их обратно в аудио. Модель использует технологию RVQ (Residual Vector Quantization) — квантование с остаточным вектором, которое кодирует аудио в дискретные токены.

Количество параметров

CSM-1B содержит 1 миллиард параметров. Это относительно компактный размер для современной модели генеративного ИИ, что обеспечивает высокую производительность даже на мобильных устройствах.

Производительность и эффективность

На тестовом стенде с процессором Snapdragon 865 модель работает со скоростью примерно 2× от реального времени — то есть генерирует речь быстрее, чем она воспроизводится. Это открывает возможности для создания голосовых ассистентов, которые работают полностью офлайн, без необходимости отправлять данные в облако, что критически важно для приватности пользователей.

Поддержка языков

Модель в первую очередь оптимизирована для английского языка. У неё есть ограниченные возможности для неанглийских языков из-за наличия данных других языков в обучающем наборе. Выходной аудиоформат — стерео с частотой дискретизации 24 кГц.

Аппаратные требования

Рекомендуется GPU с поддержкой CUDA (код тестировался с CUDA 12.4 и 12.6), Python 3.10. Модель нативно интегрирована в Hugging Face Transformers начиная с версии 4.52.1.

Дата выхода и версии

Анонс и первый релиз — 13 марта 2025 года. Интеграция в Transformers — 20 мая 2025 года. Доступность через OpenRouter — 23 апреля 2026 года. Существуют также дообученные варианты от сообщества.

Лицензия

Apache 2.0, разрешает коммерческое использование. Компания Sesame не внедрила технических защитных механизмов, полагаясь на этические рекомендации.

Сценарии использования

голосовые ассистенты и чат-боты, мобильные приложения (офлайн-режим), интерактивные демонстрации, исследования в области разговорного ИИ.

Официальный сайт

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *