BAAI/bge-m3: универсальная мультиязычная модель для поиска и эмбеддингов

BGE-M3 (BAAI General Embedding — Multi-linguality, Multi-granularity, Multi-functionality) — это мощная текстовая модель для получения эмбеддингов, разработанная Пекинской академией искусственного интеллекта (BAAI). Модель является частью популярного семейства BGE и представляет собой первую модель эмбеддингов, которая одновременно поддерживает все три основных метода поиска: плотный (dense), разреженный (sparse) и мультивекторный (multi-vector/ColBERT).

Вступление

BGE-M3 (BAAI General Embedding — Multi-linguality, Multi-granularity, Multi-functionality) — это мощная текстовая модель для получения эмбеддингов, разработанная Пекинской академией искусственного интеллекта (BAAI). Модель является частью популярного семейства BGE и представляет собой первую модель эмбеддингов, которая одновременно поддерживает все три основных метода поиска: плотный (dense), разреженный (sparse) и мультивекторный (multi-vector/ColBERT). Официальный сайт: https://huggingface.co/BAAI.

Название M3 раскрывает три ключевых принципа модели:

  • Multi-linguality — поддержка 100+ языков.
  • Multi-granularity — обработка текстов разной длины, от коротких предложений до длинных документов до 8192 токенов.
  • Multi-functionality — объединение трёх методов поиска в одной модели.

Модель распространяется под лицензией MIT, что делает её доступной как для исследовательских, так и для коммерческих целей. BGE-M3 является одной из самых востребованных открытых моделей эмбеддингов для RAG-систем, семантического поиска и мультиязычных приложений.

Технические характеристики

Параметр Значение
Архитектура XLM-RoBERTa (трансформер)
Общее количество параметров 568–569 миллионов (0.567B)
Размерность эмбеддинга 1024
Максимальная длина последовательности 8192 токенов
Количество языков 100+ (обучение на данных 170+ языков)
Размер модели (FP16) ~1.1 GB
Лицензия MIT

Архитектурные детали:

  • Базовый слой: XLM-RoBERTa с расширенной максимальной позицией до 8192.
  • Внимание: Multi-head attention с attention_probs_dropout_prob: 0.1.
  • Функция потерь: contrastive learning.
  • Предобучение: расширение контекста XLM-RoBERTa с 512 до 8192 токенов через RetroMAE.

Методы поиска:

  • Плотный (Dense) поиск — использование нормализованного скрытого состояния специального токена [CLS] в качестве плотного эмбеддинга.
  • Разреженный (Sparse) поиск — добавление линейного слоя и функции активации ReLU для получения весов токенов (аналогично BM25).
  • Мультивекторный (Multi-vector/ColBERT) поиск — использование всех выходных эмбеддингов для представления запроса и документа.

Важной особенностью является то, что модель одновременно может генерировать все три типа представлений для одного и того же текста без дополнительных затрат. Это позволяет использовать гибридный поиск (сочетание dense и sparse) для достижения более высокой точности.

Дата выхода и доступность

  • Официальная дата релиза: 30 января 2024 года.
  • Дата публикации на Hugging Face: 27 января 2024.
  • Модель доступна в открытых весах на Hugging Face, исходный код в репозитории FlagEmbedding, в NVIDIA NIM, DeepInfra (OpenAI-совместимый API), OpenRouter, Cloudflare Workers AI, OVHcloud AI Endpoints, Replicate, SaladCloud, MLX (квантизированные версии для Apple Silicon), GGUF.

Квантизированные версии:

Версия Размер Сжатие
FP16 1.1 GB
8-bit 592 MB 46%
6-bit 457 MB 58%
4-bit 321 MB 71%

Производительность и бенчмарки

Современное качество (SOTA) на мультиязычных и кросс-языковых бенчмарках:

  • MIRACL (мультиязычный) — SOTA.
  • MKQA (кросс-языковой) — SOTA.
  • MLDR — State-of-the-art.
  • NarrativeQA — State-of-the-art.

Примеры результатов на MTEB:

  • STS (Semantic Similarity): 0.5831
  • STSBenchmark: 0.5714
  • Classification (kNN): 0.6564
  • Banking77: 0.8027

Адаптация для редких языков:

При дообучении на низкоресурсных нигерийских языках (йоруба, игбо, хауса) модель показывает значительный прирост:

  • Йоруба: MRR с 0.7846 до 0.9201
  • Игбо: MRR с 0.7566 до 0.8638
  • Хауса: MRR с 0.8575 до 0.9230

Ценообразование (API)

Провайдер Цена за 1M токенов
DeepInfra $0.010
OpenRouter $0.01
OVHcloud €0.01

Рекомендации по использованию

Авторы модели рекомендуют следующий пайплайн для RAG-систем:

  1. Гибридный поиск — комбинация плотного и разреженного поиска с использованием BGE-M3.
  2. Ранжирование (Re-ranking) — использование кросс-энкодеров (например, bge-reranker) для финальной фильтрации результатов.

Для использования в косинусном сходстве рекомендуется нормализовать эмбеддинги (normalize_embeddings=True).

Заключение

BGE-M3 от BAAI — это универсальная модель эмбеддингов, которая решает три ключевые задачи в одной архитектуре: плотный, разреженный и мультивекторный поиск. Поддержка 100+ языков, контекстное окно в 8192 токенов и размер эмбеддинга 1024 делают её идеальным выбором для мультиязычных RAG-систем, семантического поиска и документной аналитики.

Открытая лицензия MIT, доступность через множество облачных платформ и наличие квантизированных версий обеспечивают широкий спектр вариантов развертывания — от локального запуска на потребительском оборудовании до масштабируемых корпоративных инсталляций. С момента релиза в январе 2024 года BGE-M3 стала одной из самых популярных открытых моделей эмбеддингов, подтвердив свой статус на ведущих мультиязычных бенчмарках.

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *