Mistral Voxtral Mini Transcribe V2 — высокоточная ASR с низкой стоимостью

Voxtral Mini Transcribe V2 — флагманская пакетная (offline) модель распознавания речи от французской компании Mistral AI, предназначенная для высокоточного и экономичного преобразования голосовых записей в текст. Модель является частью семейства Voxtral Transcribe 2, анонсированного 4 февраля 2026 года, и представляет собой эволюцию предыдущей версии voxtral-mini-2507. Если предыдущая версия была скорее экспериментальной, то Voxtral Mini Transcribe V2 — это полноценное промышленное решение, которое, по заявлению Mistral, устанавливает новый стандарт соотношения цены и качества на рынке ASR.

Введение

Voxtral Mini Transcribe V2 — флагманская пакетная (offline) модель распознавания речи от французской компании Mistral AI, предназначенная для высокоточного и экономичного преобразования голосовых записей в текст. Модель является частью семейства Voxtral Transcribe 2, анонсированного 4 февраля 2026 года, и представляет собой эволюцию предыдущей версии voxtral-mini-2507. Если предыдущая версия была скорее экспериментальной, то Voxtral Mini Transcribe V2 — это полноценное промышленное решение, которое, по заявлению Mistral, устанавливает новый стандарт соотношения цены и качества на рынке ASR.

Ключевое позиционирование модели — максимальная точность при минимальной стоимости. Mistral утверждает, что Voxtral Mini Transcribe V2 достигает самой низкой частоты ошибок на слова (WER) среди всех коммерческих API транскрипции при самой низкой цене. Это делает её идеальным выбором для задач, требующих обработки больших объёмов аудио: расшифровка встреч и совещаний, транскрибация интервью и подкастов, архивация телефонных звонков, создание субтитров и стенограмм для медиаконтента.

Технические характеристики

Основные параметры

  • Архитектура: Трансформерная модель, оптимизированная для восприятия аудио. Модель построена на базе эффективного аудио-энкодера, который преобразует звуковой сигнал в текстовое представление.
  • Размер модели: Около 3 миллиардов параметров (базируется на архитектуре Ministral 3B).
  • Контекстное окно: 32 000 токенов. Этого достаточно для обработки аудиозаписей длительностью до 3 часов в рамках одного запроса.
  • Модальности: Аудио → Текст.
  • Токенизатор: Собственный токенизатор Mistral, оптимизированный для мультиязычных задач.

Языковая поддержка

Модель поддерживает 13 языков:

  • Английский (English)
  • Китайский (Chinese)
  • Хинди (Hindi)
  • Испанский (Spanish)
  • Арабский (Arabic)
  • Французский (French)
  • Португальский (Portuguese)
  • Русский (Russian)
  • Немецкий (German)
  • Японский (Japanese)
  • Корейский (Korean)
  • Итальянский (Italian)
  • Нидерландский (Dutch)

Модель поддерживает автоматическое определение языка — пользователю не нужно указывать язык аудио заранее.

Ключевые особенности

  • Speaker Diarization (идентификация говорящих): Модель автоматически определяет, кто и когда говорит, расставляя метки спикеров с точными временными метками начала и окончания каждой реплики. Эта функция критически важна для расшифровки встреч, интервью и многосторонних переговоров.
  • Контекстное смещение (Context Biasing): Возможность передать модели до 100 пользовательских терминов (например, имена собственные, техническая лексика, бренды), чтобы повысить точность распознавания специфической для конкретной области лексики.
  • Временные метки на уровне слов (Word-Level Timestamps): Для каждого слова в транскрипции выдаётся точное время начала и окончания его произнесения в аудиофайле. Это незаменимо для генерации субтитров и поиска по аудиоархивам.
  • Устойчивость к шуму: Модель сохраняет высокую точность даже в сложных акустических условиях, что делает её пригодной для работы с записями, сделанными в шумной обстановке.

Дата выхода и статус

Модель Voxtral Mini Transcribe V2 была официально анонсирована и выпущена 4 февраля 2026 года. По состоянию на апрель 2026 года это актуальная пакетная ASR-модель Mistral, доступная через API. Предыдущая версия (voxtral-mini-2507) объявлена устаревшей с датой прекращения поддержки 31 мая 2026 года.

Технический отчёт с подробным описанием архитектуры и результатов доступен по ссылке: arXiv:2602.11298.

Производительность и бенчмарки

Mistral позиционирует Voxtral Mini Transcribe V2 как модель с лучшим соотношением цены и качества на рынке. Ключевые показатели:

  • WER (Word Error Rate): На бенчмарке FLEURS (охватывающем 10 языков) модель достигает частоты ошибок около 4%.
  • Сравнение с конкурентами: По утверждению Mistral, модель превосходит по точности GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal и Deepgram Nova.
  • Скорость обработки: Voxtral Mini Transcribe V2 обрабатывает аудио примерно в 3 раза быстрее, чем ElevenLabs Scribe v2, при сопоставимом качестве и в 5 раз меньшей стоимости.
  • Дираризация: Модель показывает значительное улучшение качества идентификации говорящих по сравнению с предыдущими версиями, что подтверждается тестами на пяти английских и мультиязычных бенчмарках.

Развёртывание и использование

Модель доступна через Mistral API (платформа Mistral Studio). API-эндпоинт для транскрипции: /v1/audio/transcriptions.

Ценообразование:

  • Стоимость API составляет $0.003 за минуту аудио.

Требования к входным данным:

  • Формат аудио: поддерживаются распространённые форматы (WAV, MP3 и др.)
  • Длительность: до 3 часов на один запрос

Интеграция:

  • Mistral AI Studio — веб-интерфейс для тестирования модели с поддержкой диаразации и временных меток.
  • OpenRouter — модель доступна через провайдера Mistral Voxtral Mini Transcribe V2.
  • Batch API — поддержка пакетной обработки нескольких файлов.

Лицензия и условия использования

В отличие от модели Voxtral Realtime, которая распространяется с открытыми весами под лицензией Apache 2.0, Voxtral Mini Transcribe V2 доступна исключительно через коммерческое API Mistral. Это означает, что веса модели не являются открытыми, и использование возможно только через платный API-доступ.

Экосистема Mistral Audio

Voxtral Mini Transcribe V2 является частью комплексной аудио-экосистемы Mistral, которая включает:

  • Voxtral Realtime — модель для потоковой транскрипции с задержкой менее 200 мс.
  • Voxtral TTS — модель синтеза речи и клонирования голосов.
  • Speech-to-Speech Pipeline — комплексное решение для создания голосовых агентов, способных слушать, рассуждать и отвечать.

Официальный сайт: https://mistral.ai/

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *