Sesame CSM-1B (Conversational Speech Model) — это инновационная модель генерации речи, разработанная компанией Sesame AI Labs. Модель стала широко известна как технологическая основа виртуального ассистента Maya — первого голосового ИИ, который, по мнению многих экспертов, преодолел «зловещую долину» (uncanny valley) в синтезе разговорной речи. Официальный сайт: https://www.sesame.com.
В отличие от традиционных TTS-систем, которые просто озвучивают текст, CSM-1B является мультимодальной моделью, работающей на уровне дискретных аудиокодеков. Модель принимает на вход как текст, так и аудио, и генерирует RVQ-аудиокоды, которые затем декодируются в естественную человеческую речь. Такой подход позволяет модели не только синтезировать речь, но и учитывать аудиоконтекст — например, сохранять тембр, интонацию и эмоциональную окраску голоса на основе короткого аудиопримера.
Ключевая философия Sesame при создании CSM-1B — сделать голосовой ИИ живым и естественным. Ассистенты Maya и Miles демонстрируют человеческие паттерны речи: паузы, дыхание, речевые сбои и возможность быть прерванными во время разговора — подобно тому, как это реализовано в голосовом режиме OpenAI. Модель распространяется по открытой лицензии Apache 2.0, что позволяет использовать её в коммерческих проектах с минимальными ограничениями. Вес модели доступен для скачивания на Hugging Face, а код — в репозитории SesameAILabs/csm на GitHub.
Архитектура и принцип работы
Sesame CSM-1B построена на гибридной архитектуре, сочетающей основной блок (backbone) на основе модели Llama от Meta и небольшой аудиодекодер, который производит Mimi-аудиокоды. Mimi — это предобученная кодек-модель, разработанная компанией Kyutai, которая кодирует речь в дискретные токены и декодирует их обратно в аудио. Модель использует технологию RVQ (Residual Vector Quantization) — квантование с остаточным вектором, которое кодирует аудио в дискретные токены.
Количество параметров
CSM-1B содержит 1 миллиард параметров. Это относительно компактный размер для современной модели генеративного ИИ, что обеспечивает высокую производительность даже на мобильных устройствах.
Производительность и эффективность
На тестовом стенде с процессором Snapdragon 865 модель работает со скоростью примерно 2× от реального времени — то есть генерирует речь быстрее, чем она воспроизводится. Это открывает возможности для создания голосовых ассистентов, которые работают полностью офлайн, без необходимости отправлять данные в облако, что критически важно для приватности пользователей.
Поддержка языков
Модель в первую очередь оптимизирована для английского языка. У неё есть ограниченные возможности для неанглийских языков из-за наличия данных других языков в обучающем наборе. Выходной аудиоформат — стерео с частотой дискретизации 24 кГц.
Аппаратные требования
Рекомендуется GPU с поддержкой CUDA (код тестировался с CUDA 12.4 и 12.6), Python 3.10. Модель нативно интегрирована в Hugging Face Transformers начиная с версии 4.52.1.
Дата выхода и версии
Анонс и первый релиз — 13 марта 2025 года. Интеграция в Transformers — 20 мая 2025 года. Доступность через OpenRouter — 23 апреля 2026 года. Существуют также дообученные варианты от сообщества.
Лицензия
Apache 2.0, разрешает коммерческое использование. Компания Sesame не внедрила технических защитных механизмов, полагаясь на этические рекомендации.
Сценарии использования
голосовые ассистенты и чат-боты, мобильные приложения (офлайн-режим), интерактивные демонстрации, исследования в области разговорного ИИ.


