Mistral Medium 3.5: флагманская объединённая модель с открытым весом от Mistral AI

Mistral Medium 3.5 — это флагманская модель с открытым исходным кодом, разработанная французской компанией Mistral AI. Она представляет собой первую объединённую (merged) модель компании, которая объединяет в едином наборе весов три ключевые компетенции: следование инструкциям, глубокое рассуждение и написание кода.

Вступление

Mistral Medium 3.5 — это флагманская модель с открытым исходным кодом, разработанная французской компанией Mistral AI. Она представляет собой первую объединённую (merged) модель компании, которая объединяет в едином наборе весов три ключевые компетенции: следование инструкциям, глубокое рассуждение и написание кода. Официальный сайт: https://mistral.ai.

Главная инновация модели — возможность гибко управлять вычислительными затратами на этапе вывода: один и тот же экземпляр модели может либо давать мгновенный ответ без рассуждений, либо проводить длительную многошаговую цепочку размышлений для решения сложных агентных задач. Это делает Mistral Medium 3.5 универсальным инструментом — от быстрых чат-ответов до автономных агентов, работающих в облаке.

Модель распространяется под лицензией Modified MIT, что разрешает как коммерческое, так и некоммерческое использование (с исключениями для компаний с крупной выручкой). Mistral Medium 3.5 стала новой моделью по умолчанию в Le Chat (чат-интерфейсе Mistral) и в Vibe CLI — инструменте для асинхронного программирования с удалёнными агентами.

Технические характеристики

Параметр Значение
Архитектура Dense (плотная), без MoE
Общее количество параметров 128 миллиардов (128B)
Длина контекста 256K токенов (262 144)
Механизм внимания GQA (Grouped Query Attention) — 96 голов, 8 KV-голов, head_dim=128
Мультимодальность Текст + изображения (вход), текст (выход)
Визуальный энкодер Обучен с нуля, 48 слоёв, patch_size=14, spatial_merge=2, image_size=1540 (стиль Pixtral)
Языковая поддержка 24 языка, включая английский, французский, испанский, немецкий, итальянский, португальский, голландский, китайский, японский, корейский, арабский, персидский, русский, хинди и др.
Расширение контекста YARN RoPE scaling на базе оригинального 4K base
Квантизация FP8 e4m3 static-tensor (родная поддержка)
Лицензия Modified MIT

Модель построена на базе Mistral 3 с механизмом YARN RoPE для поддержки контекста в 256K токенов. Визуальный энкодер был обучен с нуля для работы с изображениями произвольных размеров и соотношений сторон.

Аппаратные требования и тензорный параллелизм:

  • FP8-версия (~130 ГБ) требует —tp 4 на Hopper (H100/H200) и —tp 2 на Blackwell (B200/B300).
  • Поддерживаемое оборудование: NVIDIA Ampere (A100), Hopper (H100, H200), Blackwell (B100, B200, GB200).
  • Поддерживаемые рантаймы: vLLM, SGLang, Transformers, llama.cpp, LM Studio.

Дата выхода и доступность

  • Официальная дата выхода: 29 апреля 2026 года (также упоминается 1 мая 2026 в некоторых каталогах).
  • Модель доступна в открытых весах на Hugging Face, в Mistral API (идентификатор mistral-medium-3.5), в NVIDIA NIM, в Microsoft Foundry (Azure), на OpenRouter, а также в GGUF-формате для локального запуска.
  • Выпущена EAGLE-версия для ускорения инференса через vLLM и SGLang.

Бенчмарки и производительность

Бенчмарк Результат
SWE-Bench Verified 77.6%
τ³-Telecom 91.4%
COLLIE 95.8%

Модель превосходит все предыдущие модели Mistral для написания кода, включая Devstral 2, по всем бенчмаркам. Она также показывает результаты, превышающие Qwen3.5 397B A17B.

Ключевые сценарии использования:

  • Агентные рабочие процессы с вызовом функций и структурированным JSON-выводом.
  • Долгосрочные задачи с множеством вызовов инструментов.
  • Асинхронные облачные агенты в Vibe CLI.
  • Мультимодальное понимание изображений.

Ценообразование (API)

Тип токенов Цена за 1M
Входные $1.50
Выходные $7.50

Режим рассуждения (Reasoning Effort)

Уникальная особенность модели — настраиваемое усилие рассуждения на каждый запрос:

  • reasoning_effort=»none» — мгновенный ответ без цепочки рассуждений (рекомендуемая температура: 0.0–0.7).
  • reasoning_effort=»high» — глубокая цепочка рассуждений для сложных задач и агентных сценариев (рекомендуемая температура: 0.7, top_p: 0.95).

Заключение

Mistral Medium 3.5 — это поворотный момент в стратегии Mistral AI: переход к единой универсальной модели вместо набора специализированных решений. Объединение инструкций, рассуждений и кодинга в 128B-параметрическом плотном корпусе с возможностью гибкого управления вычислительными затратами делает модель привлекательным выбором для широкого спектра задач — от простых чат-ответов до сложных многошаговых агентных рабочих процессов.

Открытые веса под коммерчески-дружественной лицензией, поддержка мультимодальности, 24 языка и возможность запуска на 4 GPU делают Mistral Medium 3.5 одной из самых доступных и мощных моделей в своём классе. Модель уже интегрирована в экосистему Mistral (Le Chat, Vibe CLI) и доступна через ведущих облачных провайдеров и API-платформы.

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *