OpenAI GPT-4o Transcribe — это флагманская модель автоматического распознавания речи (ASR) нового поколения от компании OpenAI, представленная в марте 2025 года. Модель построена на архитектуре мультимодальной GPT-4o и пришла на смену двухлетней открытой модели Whisper, которая долгое время считалась индустриальным стандартом в области транскрипции аудио.
Главное отличие GPT-4o Transcribe от предшественников — использование сквозной мультимодальной архитектуры, где аудио обрабатывается непосредственно на уровне GPT-4o без промежуточных преобразований. Это позволяет модели улавливать тонкие нюансы речи: акценты, эмоциональную окраску, фоновый шум и специфическую терминологию — с точностью, недоступной для традиционных ASR-систем.
Модель доступна исключительно через API OpenAI и не распространяется в виде открытых весов, что отличает её от Whisper. Она является частью экосистемы Azure OpenAI Service, доступна на платформах Cloudflare AI и OpenRouter. Вместе с GPT-4o Transcribe OpenAI также выпустила GPT-4o-mini-transcribe (облегчённая версия для быстрых транскрипций) и GPT-4o-mini-tts (текст-в-речь), а также специализированную версию с диаризацией — GPT-4o-transcribe-diarize.
Архитектура и принцип работы
GPT-4o Transcribe построена на базе мультимодальной архитектуры GPT-4o, которая изначально обучалась на тексте, изображениях и аудио. В отличие от Whisper, где аудиосигнал сначала преобразуется в спектрограмму и обрабатывается отдельным кодировщиком, GPT-4o Transcribe работает с аудио нативно, в том же токеновом пространстве, что и текст. Это позволяет модели лучше понимать контекст и связывать акустические сигналы с семантикой.
Контекстное окно и лимиты токенов
Модель имеет контекстное окно размером 16 000 токенов, что позволяет обрабатывать длинные аудиозаписи за один проход. Максимальный объём выходных токенов составляет 2 000 токенов. Согласно данным с платформы OpenRouter, модель поддерживает контекстное окно до 128 000 токенов — вероятно, это значение относится к суммарному объёму входного аудио в токен-эквиваленте.
Поддерживаемые форматы аудио
flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
Точность распознавания
По данным OpenAI, в тестах на 33 языках GPT-4o Transcribe демонстрирует значительно более низкий показатель Word Error Rate (WER) по сравнению с Whisper. Для английского языка WER составляет всего 2.46%. Это один из лучших показателей среди публично доступных ASR-моделей.
Поддержка языков
33 языка, точность значительно выше, чем у Whisper, особенно для английского.
Дополнительные функции
API поддерживает промпты для управления стилем транскрипции, языковые подсказки, опцию logprobs.
Дата выхода и версии
Анонс и релиз — 20 марта 2025 года. Knowledge cutoff — 1 июня 2024 года. Доступность через OpenRouter — 27–28 апреля 2026 года. Версии: gpt-4o-transcribe, gpt-4o-mini-transcribe, gpt-4o-mini-transcribe-2025-12-15, gpt-4o-transcribe-diarize.
Ценообразование
Входные токены (аудио) — $2.50 за 1M, выходные (текст) — $10.00 за 1M. GPT-4o-mini-transcribe стоит $1.25 за 1M входных токенов.
Сценарии использования
корпоративная транскрипция, медицина и юриспруденция, мультиязычные проекты, агентные системы, аналитика контента, realtime-приложения.



