Qwen Qwen3-Embedding-4B: компактный многоязычный текстовый эмбеддинг

Qwen3-Embedding-4B — это флагманская модель текстового эмбеддинга среднего размера из нового поколения семейства Qwen от компании Alibaba Cloud, представленная в июне 2025 года. Модель входит в линейку Qwen3 Embedding, которая включает три варианта (0.6B, 4B и 8B параметров) и предназначена для задач преобразования текста в плотные векторные представления — семантического поиска, классификации, кластеризации и跨языкового извлечения информации.

Qwen3-Embedding-4B — это флагманская модель текстового эмбеддинга среднего размера из нового поколения семейства Qwen от компании Alibaba Cloud, представленная в июне 2025 года. Модель входит в линейку Qwen3 Embedding, которая включает три варианта (0.6B, 4B и 8B параметров) и предназначена для задач преобразования текста в плотные векторные представления — семантического поиска, классификации, кластеризации икроссъязыкового извлечения информации. Официальный сайт: https://qwenlm.github.io.

Qwen3-Embedding-4B построена на основе плотных базовых моделей Qwen3 и наследует их выдающиеся мультиязычные способности, навыки понимания длинных текстов и логического вывода. Модель использует архитектуру decoder-only в стиле LLM с пулингом последнего токена для получения плотных векторных представлений. Такой подход отличает её от традиционных энкодерных моделей и позволяет достигать впечатляющих результатов при относительно компактном размере.

Ключевая особенность Qwen3-Embedding-4B — поддержка Matryoshka Representation Learning (MRL): пользователь может динамически изменять размерность выходного вектора в диапазоне от 32 до 2560 без потери семантической согласованности. Это даёт уникальную гибкость: для задач, где критична скорость или экономия памяти, можно использовать векторы меньшей размерности, а для максимальной точности — полные 2560 измерений.

Модель распространяется под открытой лицензией Apache 2.0, что разрешает коммерческое использование. Веса доступны для скачивания на Hugging Face, а код и документация — в официальном репозитории QwenLM на GitHub.

Архитектура и принцип работы

Qwen3-Embedding-4B построена на архитектуре decoder-only (Qwen3ForCausalLM) с использованием последнего токена для пулинга (last-token pooling). Модель состоит из 36 слоёв Transformer с плотным механизмом внимания (Dense Attention). В отличие от традиционных энкодерных моделей (например, BERT), которые используют [CLS]-токен для получения вектора предложения, Qwen3-Embedding извлекает скрытое состояние специального токена, добавляемого в конец последовательности, что обеспечивает более качественное представление всего текста.

Контекстное окно

Модель поддерживает контекстное окно размером 32 768 токенов (32K). Это позволяет обрабатывать длинные документы — научные статьи, юридические контракты, техническую документацию — за один проход без необходимости чанкинга.

Размерность эмбеддингов

Базовая размерность выходного вектора составляет 2560 измерений. Благодаря MRL пользователь может задавать произвольную размерность от 32 до 2560.

Поддержка языков и типов данных

Модель поддерживает более 100 естественных языков, а также множество языков программирования. Это обеспечивает кросс-языковой поиск и поиск по коду.

Instruction-Aware

Модель поддерживает пользовательские инструкции на этапе запроса.

Дата выхода и версии

Анонс и релиз — 5–6 июня 2025 года. Доступность через OpenRouter — 28 октября 2025 года. Обновления: 20 июня 2025 года, 3 августа 2025 года (GGUF-квантованные версии). В серии Qwen3 Embedding есть модели 0.6B, 4B, 8B.

Ценообразование (OpenRouter)

Входные токены — $0.02 за 1M.

Сценарии использования

семантический поиск, поиск по коду, классификация текстов, кластеризация, двуязычное извлечение, RAG-системы.

Официальный сайт

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *