OpenAI Whisper Large-v3 — точная модель транскрипции речи

OpenAI Whisper Large V3 — наиболее точная open-source модель ASR от OpenAI с максимальным качеством транскрипции.

Вступление

Whisper Large-v3 — это флагманская модель автоматического распознавания речи (ASR) с открытым исходным кодом от компании OpenAI, выпущенная в ноябре 2023 года. Являясь частью семейства Whisper, модель представляет собой последовательную архитектуру «кодер-декодер» на основе Transformer и позиционируется как решение для транскрипции и перевода речи . Large-v3 стала прямым развитием предыдущих версий large и large-v2 . В отличие от многих других систем OpenAI, модель и её предобученные веса распространяются под свободной лицензией MIT, что позволяет использовать, модифицировать и коммерциализировать их без ограничений. Это делает Whisper Large-v3 основой для множества сторонних проектов и решений в области распознавания речи. Официальный сайт: https://openai.com.


Технические характеристики

Архитектура и параметры

Whisper Large-v3 построена на трансформерной архитектуре «кодер-декодер» и насчитывает 1550 миллионов (1,55 млрд) параметров . Модель использует механизм внимания, оптимизированный для задач распознавания речи .

Ключевые архитектурные изменения по сравнению с Large-v2:

  • Спектрограмма входа использует 128 Mel-частотных бинов вместо 80

  • Добавлен новый языковой токен для кантонского диалекта

  • Модель имеет 32 блока Transformer

Входные и выходные данные

Модель принимает на вход аудиофайлы в распространённых форматах: mp3, mp4, wav, webm, flac, ogg, m4a . Аудио обрабатывается сегментами, оптимизированными для 30-секундных фрагментов с минимальной длительностью 10 секунд .

На выходе модель предоставляет:

  • Текст транскрипции на языке оригинала (ASR)

  • Перевод речи на английский язык (speech translation)

  • Временные метки на уровне слов и сегментов

Языковая поддержка

Whisper Large-v3 поддерживает 99+ языков, что делает её одной из самых многоязычных моделей ASR на рынке .

Данные обучения

Модель была обучена на впечатляющем объёме данных:

  • 1 миллион часов слабо размеченного аудио

  • 4 миллиона часов псевдоразмеченного аудио, сгенерированного Whisper Large-v2

  • Обучение проводилось в течение 2,0 эпох на этом смешанном наборе данных

Для сравнения: оригинальные модели Whisper обучались на 680 000 часах аудио из интернета , из которых 65% составляли англоязычные данные .

Аппаратные требования

Размер модели составляет около 3,1 ГБ. Для инференса рекомендуется не менее 8 ГБ оперативной памяти на macOS, а для работы large-v3 требуется 10 ГБ VRAM.


Дата выхода и версии

Версия Дата выхода
Оригинальный Whisper Сентябрь 2022
Whisper Large-v2 Декабрь 2022
Whisper Large-v3 6 ноября 2023
Whisper Large-v3-turbo Сентябрь 2024

Large-v3 была анонсирована и выпущена на конференции OpenAI DevDay 6 ноября 2023 года.


Производительность и точность

Показатели WER (Word Error Rate)

Whisper Large-v3 демонстрирует высокую точность распознавания:

  • Короткие транскрипции: 8,4% WER (лидирующий показатель в отрасли)

  • Последовательные длинные аудио: 10,0% WER

  • Чанкованные длинные аудио: 11,0% WER

  • В целом модель достигает 10,3% WER

По сравнению с Whisper Large-v2, ошибки сокращены на 10–20% на многих языках . Модель достигает 189-кратного ускорения относительно реального времени .

Сравнение с конкурентами

В идентичных условиях Whisper Large-v3 показывает WER/CER 11,61%, превосходя Whisper Turbo (12,97%).


Доступность и использование

Whisper Large-v3 доступна через:

  • Открытые веса на Hugging Face и GitHub под лицензией MIT

  • OpenAI API (endpoint whisper )

  • Сторонних провайдеров: Groq , OpenRouter , Azure AI , Replicate, Vercel AI Gateway и другие

Ценообразование (API)

Через OpenRouter стоимость составляет $0,0015 за минуту аудио .


Области применения

Модель идеально подходит для :

  • Юридической и медицинской транскрипции, требующей высокой точности

  • Академических исследований и транскрипции интервью

  • Многоязычных приложений: международные конференции, глобальная поддержка клиентов

  • Работы в шумных условиях и с несколькими говорящими

  • Специализированной лексики и технических терминов


Ограничения

  • Галлюцинации: модель склонна к генерации вымышленного текста, особенно на тихих или бессловесных участках аудио

  • Требования к оборудованию: для работы необходимы значительные вычислительные ресурсы (10 ГБ VRAM)

  • Не рекомендуется для высокорисковых областей принятия решений и для классификации, особенно для вывода о человеческих качествах


Заключение

OpenAI Whisper Large-v3 остаётся одной из самых мощных и доступных моделей автоматического распознавания речи на рынке. Сочетая передовую архитектуру, поддержку 99+ языков, высокую точность и открытую лицензию, модель стала стандартом де-факто в области ASR. Несмотря на появление более новых моделей, таких как GPT-4o-transcribe, Whisper Large-v3 продолжает доминировать в самохостовых и on-device решениях благодаря своей доступности и зрелой экосистеме.

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *