Вступление
Mistral Medium 3.5 — это флагманская модель с открытым исходным кодом, разработанная французской компанией Mistral AI. Она представляет собой первую объединённую (merged) модель компании, которая объединяет в едином наборе весов три ключевые компетенции: следование инструкциям, глубокое рассуждение и написание кода. Официальный сайт: https://mistral.ai.
Главная инновация модели — возможность гибко управлять вычислительными затратами на этапе вывода: один и тот же экземпляр модели может либо давать мгновенный ответ без рассуждений, либо проводить длительную многошаговую цепочку размышлений для решения сложных агентных задач. Это делает Mistral Medium 3.5 универсальным инструментом — от быстрых чат-ответов до автономных агентов, работающих в облаке.
Модель распространяется под лицензией Modified MIT, что разрешает как коммерческое, так и некоммерческое использование (с исключениями для компаний с крупной выручкой). Mistral Medium 3.5 стала новой моделью по умолчанию в Le Chat (чат-интерфейсе Mistral) и в Vibe CLI — инструменте для асинхронного программирования с удалёнными агентами.
Технические характеристики
| Параметр | Значение |
|---|---|
| Архитектура | Dense (плотная), без MoE |
| Общее количество параметров | 128 миллиардов (128B) |
| Длина контекста | 256K токенов (262 144) |
| Механизм внимания | GQA (Grouped Query Attention) — 96 голов, 8 KV-голов, head_dim=128 |
| Мультимодальность | Текст + изображения (вход), текст (выход) |
| Визуальный энкодер | Обучен с нуля, 48 слоёв, patch_size=14, spatial_merge=2, image_size=1540 (стиль Pixtral) |
| Языковая поддержка | 24 языка, включая английский, французский, испанский, немецкий, итальянский, португальский, голландский, китайский, японский, корейский, арабский, персидский, русский, хинди и др. |
| Расширение контекста | YARN RoPE scaling на базе оригинального 4K base |
| Квантизация | FP8 e4m3 static-tensor (родная поддержка) |
| Лицензия | Modified MIT |
Модель построена на базе Mistral 3 с механизмом YARN RoPE для поддержки контекста в 256K токенов. Визуальный энкодер был обучен с нуля для работы с изображениями произвольных размеров и соотношений сторон.
Аппаратные требования и тензорный параллелизм:
- FP8-версия (~130 ГБ) требует —tp 4 на Hopper (H100/H200) и —tp 2 на Blackwell (B200/B300).
- Поддерживаемое оборудование: NVIDIA Ampere (A100), Hopper (H100, H200), Blackwell (B100, B200, GB200).
- Поддерживаемые рантаймы: vLLM, SGLang, Transformers, llama.cpp, LM Studio.
Дата выхода и доступность
- Официальная дата выхода: 29 апреля 2026 года (также упоминается 1 мая 2026 в некоторых каталогах).
- Модель доступна в открытых весах на Hugging Face, в Mistral API (идентификатор mistral-medium-3.5), в NVIDIA NIM, в Microsoft Foundry (Azure), на OpenRouter, а также в GGUF-формате для локального запуска.
- Выпущена EAGLE-версия для ускорения инференса через vLLM и SGLang.
Бенчмарки и производительность
| Бенчмарк | Результат |
|---|---|
| SWE-Bench Verified | 77.6% |
| τ³-Telecom | 91.4% |
| COLLIE | 95.8% |
Модель превосходит все предыдущие модели Mistral для написания кода, включая Devstral 2, по всем бенчмаркам. Она также показывает результаты, превышающие Qwen3.5 397B A17B.
Ключевые сценарии использования:
- Агентные рабочие процессы с вызовом функций и структурированным JSON-выводом.
- Долгосрочные задачи с множеством вызовов инструментов.
- Асинхронные облачные агенты в Vibe CLI.
- Мультимодальное понимание изображений.
Ценообразование (API)
| Тип токенов | Цена за 1M |
|---|---|
| Входные | $1.50 |
| Выходные | $7.50 |
Режим рассуждения (Reasoning Effort)
Уникальная особенность модели — настраиваемое усилие рассуждения на каждый запрос:
- reasoning_effort=»none» — мгновенный ответ без цепочки рассуждений (рекомендуемая температура: 0.0–0.7).
- reasoning_effort=»high» — глубокая цепочка рассуждений для сложных задач и агентных сценариев (рекомендуемая температура: 0.7, top_p: 0.95).
Заключение
Mistral Medium 3.5 — это поворотный момент в стратегии Mistral AI: переход к единой универсальной модели вместо набора специализированных решений. Объединение инструкций, рассуждений и кодинга в 128B-параметрическом плотном корпусе с возможностью гибкого управления вычислительными затратами делает модель привлекательным выбором для широкого спектра задач — от простых чат-ответов до сложных многошаговых агентных рабочих процессов.
Открытые веса под коммерчески-дружественной лицензией, поддержка мультимодальности, 24 языка и возможность запуска на 4 GPU делают Mistral Medium 3.5 одной из самых доступных и мощных моделей в своём классе. Модель уже интегрирована в экосистему Mistral (Le Chat, Vibe CLI) и доступна через ведущих облачных провайдеров и API-платформы.



