OpenAI GPT-4o Transcribe: мультимодальная модель транскрипции аудио

GPT-4o Transcribe — это флагманская модель автоматического распознавания речи (ASR) нового поколения от компании OpenAI, представленная в марте 2025 года. Модель построена на архитектуре мультимодальной GPT-4o и пришла на смену двухлетней открытой модели Whisper, которая долгое время считалась индустриальным стандартом в области транскрипции аудио.

OpenAI GPT-4o Transcribe — это флагманская модель автоматического распознавания речи (ASR) нового поколения от компании OpenAI, представленная в марте 2025 года. Модель построена на архитектуре мультимодальной GPT-4o и пришла на смену двухлетней открытой модели Whisper, которая долгое время считалась индустриальным стандартом в области транскрипции аудио.

Главное отличие GPT-4o Transcribe от предшественников — использование сквозной мультимодальной архитектуры, где аудио обрабатывается непосредственно на уровне GPT-4o без промежуточных преобразований. Это позволяет модели улавливать тонкие нюансы речи: акценты, эмоциональную окраску, фоновый шум и специфическую терминологию — с точностью, недоступной для традиционных ASR-систем.

Модель доступна исключительно через API OpenAI и не распространяется в виде открытых весов, что отличает её от Whisper. Она является частью экосистемы Azure OpenAI Service, доступна на платформах Cloudflare AI и OpenRouter. Вместе с GPT-4o Transcribe OpenAI также выпустила GPT-4o-mini-transcribe (облегчённая версия для быстрых транскрипций) и GPT-4o-mini-tts (текст-в-речь), а также специализированную версию с диаризацией — GPT-4o-transcribe-diarize.

Архитектура и принцип работы

GPT-4o Transcribe построена на базе мультимодальной архитектуры GPT-4o, которая изначально обучалась на тексте, изображениях и аудио. В отличие от Whisper, где аудиосигнал сначала преобразуется в спектрограмму и обрабатывается отдельным кодировщиком, GPT-4o Transcribe работает с аудио нативно, в том же токеновом пространстве, что и текст. Это позволяет модели лучше понимать контекст и связывать акустические сигналы с семантикой.

Контекстное окно и лимиты токенов

Модель имеет контекстное окно размером 16 000 токенов, что позволяет обрабатывать длинные аудиозаписи за один проход. Максимальный объём выходных токенов составляет 2 000 токенов. Согласно данным с платформы OpenRouter, модель поддерживает контекстное окно до 128 000 токенов — вероятно, это значение относится к суммарному объёму входного аудио в токен-эквиваленте.

Поддерживаемые форматы аудио

flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.

Точность распознавания

По данным OpenAI, в тестах на 33 языках GPT-4o Transcribe демонстрирует значительно более низкий показатель Word Error Rate (WER) по сравнению с Whisper. Для английского языка WER составляет всего 2.46%. Это один из лучших показателей среди публично доступных ASR-моделей.

Поддержка языков

33 языка, точность значительно выше, чем у Whisper, особенно для английского.

Дополнительные функции

API поддерживает промпты для управления стилем транскрипции, языковые подсказки, опцию logprobs.

Дата выхода и версии

Анонс и релиз — 20 марта 2025 года. Knowledge cutoff — 1 июня 2024 года. Доступность через OpenRouter — 27–28 апреля 2026 года. Версии: gpt-4o-transcribe, gpt-4o-mini-transcribe, gpt-4o-mini-transcribe-2025-12-15, gpt-4o-transcribe-diarize.

Ценообразование

Входные токены (аудио) — $2.50 за 1M, выходные (текст) — $10.00 за 1M. GPT-4o-mini-transcribe стоит $1.25 за 1M входных токенов.

Сценарии использования

корпоративная транскрипция, медицина и юриспруденция, мультиязычные проекты, агентные системы, аналитика контента, realtime-приложения.

Официальный сайт

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *