Вступление
BGE-M3 (BAAI General Embedding — Multi-linguality, Multi-granularity, Multi-functionality) — это мощная текстовая модель для получения эмбеддингов, разработанная Пекинской академией искусственного интеллекта (BAAI). Модель является частью популярного семейства BGE и представляет собой первую модель эмбеддингов, которая одновременно поддерживает все три основных метода поиска: плотный (dense), разреженный (sparse) и мультивекторный (multi-vector/ColBERT). Официальный сайт: https://huggingface.co/BAAI.
Название M3 раскрывает три ключевых принципа модели:
- Multi-linguality — поддержка 100+ языков.
- Multi-granularity — обработка текстов разной длины, от коротких предложений до длинных документов до 8192 токенов.
- Multi-functionality — объединение трёх методов поиска в одной модели.
Модель распространяется под лицензией MIT, что делает её доступной как для исследовательских, так и для коммерческих целей. BGE-M3 является одной из самых востребованных открытых моделей эмбеддингов для RAG-систем, семантического поиска и мультиязычных приложений.
Технические характеристики
| Параметр | Значение |
|---|---|
| Архитектура | XLM-RoBERTa (трансформер) |
| Общее количество параметров | 568–569 миллионов (0.567B) |
| Размерность эмбеддинга | 1024 |
| Максимальная длина последовательности | 8192 токенов |
| Количество языков | 100+ (обучение на данных 170+ языков) |
| Размер модели (FP16) | ~1.1 GB |
| Лицензия | MIT |
Архитектурные детали:
- Базовый слой: XLM-RoBERTa с расширенной максимальной позицией до 8192.
- Внимание: Multi-head attention с attention_probs_dropout_prob: 0.1.
- Функция потерь: contrastive learning.
- Предобучение: расширение контекста XLM-RoBERTa с 512 до 8192 токенов через RetroMAE.
Методы поиска:
- Плотный (Dense) поиск — использование нормализованного скрытого состояния специального токена [CLS] в качестве плотного эмбеддинга.
- Разреженный (Sparse) поиск — добавление линейного слоя и функции активации ReLU для получения весов токенов (аналогично BM25).
- Мультивекторный (Multi-vector/ColBERT) поиск — использование всех выходных эмбеддингов для представления запроса и документа.
Важной особенностью является то, что модель одновременно может генерировать все три типа представлений для одного и того же текста без дополнительных затрат. Это позволяет использовать гибридный поиск (сочетание dense и sparse) для достижения более высокой точности.
Дата выхода и доступность
- Официальная дата релиза: 30 января 2024 года.
- Дата публикации на Hugging Face: 27 января 2024.
- Модель доступна в открытых весах на Hugging Face, исходный код в репозитории FlagEmbedding, в NVIDIA NIM, DeepInfra (OpenAI-совместимый API), OpenRouter, Cloudflare Workers AI, OVHcloud AI Endpoints, Replicate, SaladCloud, MLX (квантизированные версии для Apple Silicon), GGUF.
Квантизированные версии:
| Версия | Размер | Сжатие |
|---|---|---|
| FP16 | 1.1 GB | — |
| 8-bit | 592 MB | 46% |
| 6-bit | 457 MB | 58% |
| 4-bit | 321 MB | 71% |
Производительность и бенчмарки
Современное качество (SOTA) на мультиязычных и кросс-языковых бенчмарках:
- MIRACL (мультиязычный) — SOTA.
- MKQA (кросс-языковой) — SOTA.
- MLDR — State-of-the-art.
- NarrativeQA — State-of-the-art.
Примеры результатов на MTEB:
- STS (Semantic Similarity): 0.5831
- STSBenchmark: 0.5714
- Classification (kNN): 0.6564
- Banking77: 0.8027
Адаптация для редких языков:
При дообучении на низкоресурсных нигерийских языках (йоруба, игбо, хауса) модель показывает значительный прирост:
- Йоруба: MRR с 0.7846 до 0.9201
- Игбо: MRR с 0.7566 до 0.8638
- Хауса: MRR с 0.8575 до 0.9230
Ценообразование (API)
| Провайдер | Цена за 1M токенов |
|---|---|
| DeepInfra | $0.010 |
| OpenRouter | $0.01 |
| OVHcloud | €0.01 |
Рекомендации по использованию
Авторы модели рекомендуют следующий пайплайн для RAG-систем:
- Гибридный поиск — комбинация плотного и разреженного поиска с использованием BGE-M3.
- Ранжирование (Re-ranking) — использование кросс-энкодеров (например, bge-reranker) для финальной фильтрации результатов.
Для использования в косинусном сходстве рекомендуется нормализовать эмбеддинги (normalize_embeddings=True).
Заключение
BGE-M3 от BAAI — это универсальная модель эмбеддингов, которая решает три ключевые задачи в одной архитектуре: плотный, разреженный и мультивекторный поиск. Поддержка 100+ языков, контекстное окно в 8192 токенов и размер эмбеддинга 1024 делают её идеальным выбором для мультиязычных RAG-систем, семантического поиска и документной аналитики.
Открытая лицензия MIT, доступность через множество облачных платформ и наличие квантизированных версий обеспечивают широкий спектр вариантов развертывания — от локального запуска на потребительском оборудовании до масштабируемых корпоративных инсталляций. С момента релиза в январе 2024 года BGE-M3 стала одной из самых популярных открытых моделей эмбеддингов, подтвердив свой статус на ведущих мультиязычных бенчмарках.



