Вступление
Whisper Large-v3 — это флагманская модель автоматического распознавания речи (ASR) с открытым исходным кодом от компании OpenAI, выпущенная в ноябре 2023 года. Являясь частью семейства Whisper, модель представляет собой последовательную архитектуру «кодер-декодер» на основе Transformer и позиционируется как решение для транскрипции и перевода речи . Large-v3 стала прямым развитием предыдущих версий large и large-v2 . В отличие от многих других систем OpenAI, модель и её предобученные веса распространяются под свободной лицензией MIT, что позволяет использовать, модифицировать и коммерциализировать их без ограничений. Это делает Whisper Large-v3 основой для множества сторонних проектов и решений в области распознавания речи. Официальный сайт: https://openai.com.
Технические характеристики
Архитектура и параметры
Whisper Large-v3 построена на трансформерной архитектуре «кодер-декодер» и насчитывает 1550 миллионов (1,55 млрд) параметров . Модель использует механизм внимания, оптимизированный для задач распознавания речи .
Ключевые архитектурные изменения по сравнению с Large-v2:
-
Спектрограмма входа использует 128 Mel-частотных бинов вместо 80
-
Добавлен новый языковой токен для кантонского диалекта
-
Модель имеет 32 блока Transformer
Входные и выходные данные
Модель принимает на вход аудиофайлы в распространённых форматах: mp3, mp4, wav, webm, flac, ogg, m4a . Аудио обрабатывается сегментами, оптимизированными для 30-секундных фрагментов с минимальной длительностью 10 секунд .
На выходе модель предоставляет:
-
Текст транскрипции на языке оригинала (ASR)
-
Перевод речи на английский язык (speech translation)
-
Временные метки на уровне слов и сегментов
Языковая поддержка
Whisper Large-v3 поддерживает 99+ языков, что делает её одной из самых многоязычных моделей ASR на рынке .
Данные обучения
Модель была обучена на впечатляющем объёме данных:
-
1 миллион часов слабо размеченного аудио
-
4 миллиона часов псевдоразмеченного аудио, сгенерированного Whisper Large-v2
-
Обучение проводилось в течение 2,0 эпох на этом смешанном наборе данных
Для сравнения: оригинальные модели Whisper обучались на 680 000 часах аудио из интернета , из которых 65% составляли англоязычные данные .
Аппаратные требования
Размер модели составляет около 3,1 ГБ. Для инференса рекомендуется не менее 8 ГБ оперативной памяти на macOS, а для работы large-v3 требуется 10 ГБ VRAM.
Дата выхода и версии
| Версия | Дата выхода |
|---|---|
| Оригинальный Whisper | Сентябрь 2022 |
| Whisper Large-v2 | Декабрь 2022 |
| Whisper Large-v3 | 6 ноября 2023 |
| Whisper Large-v3-turbo | Сентябрь 2024 |
Large-v3 была анонсирована и выпущена на конференции OpenAI DevDay 6 ноября 2023 года.
Производительность и точность
Показатели WER (Word Error Rate)
Whisper Large-v3 демонстрирует высокую точность распознавания:
-
Короткие транскрипции: 8,4% WER (лидирующий показатель в отрасли)
-
Последовательные длинные аудио: 10,0% WER
-
Чанкованные длинные аудио: 11,0% WER
-
В целом модель достигает 10,3% WER
По сравнению с Whisper Large-v2, ошибки сокращены на 10–20% на многих языках . Модель достигает 189-кратного ускорения относительно реального времени .
Сравнение с конкурентами
В идентичных условиях Whisper Large-v3 показывает WER/CER 11,61%, превосходя Whisper Turbo (12,97%).
Доступность и использование
Whisper Large-v3 доступна через:
-
Открытые веса на Hugging Face и GitHub под лицензией MIT
-
OpenAI API (endpoint
whisper) -
Сторонних провайдеров: Groq , OpenRouter , Azure AI , Replicate, Vercel AI Gateway и другие
Ценообразование (API)
Через OpenRouter стоимость составляет $0,0015 за минуту аудио .
Области применения
Модель идеально подходит для :
-
Юридической и медицинской транскрипции, требующей высокой точности
-
Академических исследований и транскрипции интервью
-
Многоязычных приложений: международные конференции, глобальная поддержка клиентов
-
Работы в шумных условиях и с несколькими говорящими
-
Специализированной лексики и технических терминов
Ограничения
-
Галлюцинации: модель склонна к генерации вымышленного текста, особенно на тихих или бессловесных участках аудио
-
Требования к оборудованию: для работы необходимы значительные вычислительные ресурсы (10 ГБ VRAM)
-
Не рекомендуется для высокорисковых областей принятия решений и для классификации, особенно для вывода о человеческих качествах
Заключение
OpenAI Whisper Large-v3 остаётся одной из самых мощных и доступных моделей автоматического распознавания речи на рынке. Сочетая передовую архитектуру, поддержку 99+ языков, высокую точность и открытую лицензию, модель стала стандартом де-факто в области ASR. Несмотря на появление более новых моделей, таких как GPT-4o-transcribe, Whisper Large-v3 продолжает доминировать в самохостовых и on-device решениях благодаря своей доступности и зрелой экосистеме.



