Вступление
MAI-Transcribe-1.5 — это флагманская модель автоматического распознавания речи (ASR / STT) от Microsoft AI, представляющая собой второе поколение семейства MAI-Transcribe. Она была разработана внутри компании (in-house) командой Microsoft AI (MAI) Superintelligence и позиционируется как «лучшая в мире модель транскрипции» с передовой точностью (SOTA).
Главная «фишка» модели — это беспрецедентный баланс скорости и точности, который выводит её на передний план эффективности (Pareto frontier) среди всех существующих решений. MAI-Transcribe-1.5 способна транскрибировать час аудио менее чем за 15 секунд, что в пять раз быстрее ключевых конкурентов, таких как Gemini 3.1, Scribe v2 и GPT-4o-Transcribe. При этом она обеспечивает высочайшее качество распознавания, поддерживая 43 языка и предлагая уникальную функцию контекстного учета специфической терминологии (Keyword Biasing).
MAI-Transcribe-1.5 уже интегрирована в ключевые продукты Microsoft, включая Copilot, Teams, GitHub и Dynamics 365 Contact Centre, а также доступна разработчикам через Microsoft Foundry, OpenRouter и другие платформы. Это не просто исследовательская модель, а готовое production-решение, созданное для решения реальных задач в условиях шума, различных акцентов и неидеального качества аудио.
Технические характеристики
Архитектура и назначение
MAI-Transcribe-1.5 — это модель речи-в-текст (Speech-to-Text), предназначенная для преобразования аудиосигнала в точный текстовый транскрипт. Модель оптимизирована для работы в реальных условиях и демонстрирует высокую устойчивость к фоновому шуму, различным акцентам и стилям речи. Она разработана для широкого спектра применений: от генерации субтитров и транскрибации встреч до анализа звонков, создания контента и работы голосовых агентов.
Языковая поддержка
Модель поддерживает 43 языка, что является значительным расширением по сравнению с 25 языками в предыдущей версии MAI-Transcribe-1. В базовый набор входят такие языки, как английский, французский, немецкий, испанский, итальянский, португальский, японский, корейский, китайский, арабский, хинди, русский и многие другие. Восемнадцать новых языков включают болгарский, каталонский, греческий, эстонский, литовский, словацкий, словенский, украинский, а также ряд индийских языков: ассамский, бенгальский, гуджарати, каннада, малаялам, маратхи, одия, панджаби, тамильский и телугу. Модель также поддерживает автоматическое определение языка (Automatic Language Detection).
Ключевая функция: Контекстное уточнение (Keyword / Entity Biasing)
Важнейшей инновацией MAI-Transcribe-1.5 является функция Keyword Biasing (или Entity Biasing). Эта возможность позволяет модели «знать» о специфической для домена терминологии, такой как имена собственные, научные или медицинские термины, и использовать это знание для повышения точности распознавания. При использовании этой функции, Word Error Rate (WER) может улучшиться до 30%. Модель поддерживает добавление до 200 ключевых слов для биасинга.
Точность (Word Error Rate — WER)
MAI-Transcribe-1.5 демонстрирует лучшие в своем классе показатели точности. На эталонном мультиязычном бенчмарке FLEURS она достигла наилучшего среднего показателя WER среди всех моделей, сохранив лидирующую позицию. Её средний WER на FLEURS составляет 4.9%. На бенчмарке Artificial Analysis (AA-WER) модель занимает 3-е место с результатом 2.4%, уступая лишь Alibaba Fun-Realtime-ASR-preview (1.7%) и ElevenLabs Scribe v2 (2.2%).
Для наглядности, вот сравнение WER модели на некоторых языках с конкурентами по данным FLEURS (чем ниже, тем лучше):
| Язык | MAI-Transcribe-1.5 | Scribe v2 | Gemini 3.1 Flash Lite | GPT-4o-Transcribe |
|---|---|---|---|---|
| Английский | 2.7% | 2.7% | 3.6% | 2.4% |
| Испанский | 2.2% | 2.7% | 2.4% | 2.0% |
| Французский | 2.8% | 3.6% | 4.4% | 3.1% |
| Немецкий | 2.9% | 3.5% | 3.5% | 2.5% |
| Японский | 1.9% | 2.3% | 3.9% | 2.8% |
| Китайский | 4.4% | 5.6% | 6.3% | 5.5% |
Скорость и эффективность
Скорость — это козырь MAI-Transcribe-1.5. Модель обрабатывает аудио со скоростным фактором ~276x, что означает, что она может транскрибировать 276 минут аудио за 1 минуту реального времени. Это более чем вдвое быстрее, чем вторая по скорости модель в топ-10 по точности. На длинных аудиофайлах она в 5 раз быстрее конкурентов.
Дата выхода и версии
Дата официального релиза: 2 июня 2026 года.
Семейство моделей: MAI-Transcribe-1.5 является частью более широкого семейства моделей MAI (Microsoft AI), анонсированного в июне 2026 года. В это семейство также входят модели для рассуждений (MAI-Thinking-1), кодинга (MAI-Code-1-Flash), генерации изображений (MAI-Image-2.5) и синтеза речи (MAI-Voice-2). Все эти модели разделяют общую инфраструктуру и приверженность использованию «чистых», отслеживаемых данных корпоративного уровня.
Предшественник: Предшественником модели является MAI-Transcribe-1, выпущенная 2 апреля 2026 года. Первая версия поддерживала 25 языков и уже тогда демонстрировала лидирующую точность, но уступала по скорости.
Статус и доступность: На момент выхода модели она находилась в статусе предварительной версии (Preview). Модель доступна через LLM Speech API в Azure, а также на платформах Microsoft Foundry, OpenRouter, Fireworks AI и Baseten.
Дополнительные сведения
Производительность в бенчмарках
Помимо лидерства на FLEURS и 3-го места на AA-WER, модель показывает отличные результаты на других специализированных датасетах:
- VoxPopuli-Cleaned-AA: 2-е место (1.6% WER)
- Earnings22-Cleaned-AA: 4-е место (4.0% WER)
- AA-AgentTalk: 5-е место (2.0% WER)
Ценообразование и экономическая эффективность
MAI-Transcribe-1.5 позиционируется как самое экономически эффективное решение для транскрипции среди всех гиперскейлеров. Стоимость составляет $0.36 за час аудио или $6 за 1000 минут. Для сравнения, ее предшественник MAI-Transcribe-1 стоил $0.36 в час при меньшей скорости и языковой поддержке.
Интеграция и варианты использования
Модель уже интегрирована в ключевые продукты Microsoft для улучшения пользовательского опыта. Она готова к использованию в различных корпоративных сценариях:
- Субтитры и видео: создание точных субтитров для контента.
- Анализ звонков: транскрибация и анализ разговоров в контакт-центрах.
- Инструменты доступности: создание текстовых версий аудио для людей с нарушениями слуха.
- Голосовые агенты: обеспечение понимания речи для голосовых интерфейсов.
Значимость для индустрии
MAI-Transcribe-1.5 представляет собой значительный шаг вперед для Microsoft в области ИИ, демонстрируя способность компании создавать модели мирового класса, не уступающие решениям OpenAI и Google. Она устанавливает новый стандарт для индустрии, доказывая, что высочайшая точность и экстремальная скорость могут быть достигнуты одновременно, открывая новые возможности для создания голосовых приложений в реальном времени.
Официальный сайт: https://www.microsoft.com/en-us/ai/azure-ai-speech



