Qwen3-Embedding-4B — это флагманская модель текстового эмбеддинга среднего размера из нового поколения семейства Qwen от компании Alibaba Cloud, представленная в июне 2025 года. Модель входит в линейку Qwen3 Embedding, которая включает три варианта (0.6B, 4B и 8B параметров) и предназначена для задач преобразования текста в плотные векторные представления — семантического поиска, классификации, кластеризации икроссъязыкового извлечения информации. Официальный сайт: https://qwenlm.github.io.
Qwen3-Embedding-4B построена на основе плотных базовых моделей Qwen3 и наследует их выдающиеся мультиязычные способности, навыки понимания длинных текстов и логического вывода. Модель использует архитектуру decoder-only в стиле LLM с пулингом последнего токена для получения плотных векторных представлений. Такой подход отличает её от традиционных энкодерных моделей и позволяет достигать впечатляющих результатов при относительно компактном размере.
Ключевая особенность Qwen3-Embedding-4B — поддержка Matryoshka Representation Learning (MRL): пользователь может динамически изменять размерность выходного вектора в диапазоне от 32 до 2560 без потери семантической согласованности. Это даёт уникальную гибкость: для задач, где критична скорость или экономия памяти, можно использовать векторы меньшей размерности, а для максимальной точности — полные 2560 измерений.
Модель распространяется под открытой лицензией Apache 2.0, что разрешает коммерческое использование. Веса доступны для скачивания на Hugging Face, а код и документация — в официальном репозитории QwenLM на GitHub.
Архитектура и принцип работы
Qwen3-Embedding-4B построена на архитектуре decoder-only (Qwen3ForCausalLM) с использованием последнего токена для пулинга (last-token pooling). Модель состоит из 36 слоёв Transformer с плотным механизмом внимания (Dense Attention). В отличие от традиционных энкодерных моделей (например, BERT), которые используют [CLS]-токен для получения вектора предложения, Qwen3-Embedding извлекает скрытое состояние специального токена, добавляемого в конец последовательности, что обеспечивает более качественное представление всего текста.
Контекстное окно
Модель поддерживает контекстное окно размером 32 768 токенов (32K). Это позволяет обрабатывать длинные документы — научные статьи, юридические контракты, техническую документацию — за один проход без необходимости чанкинга.
Размерность эмбеддингов
Базовая размерность выходного вектора составляет 2560 измерений. Благодаря MRL пользователь может задавать произвольную размерность от 32 до 2560.
Поддержка языков и типов данных
Модель поддерживает более 100 естественных языков, а также множество языков программирования. Это обеспечивает кросс-языковой поиск и поиск по коду.
Instruction-Aware
Модель поддерживает пользовательские инструкции на этапе запроса.
Дата выхода и версии
Анонс и релиз — 5–6 июня 2025 года. Доступность через OpenRouter — 28 октября 2025 года. Обновления: 20 июня 2025 года, 3 августа 2025 года (GGUF-квантованные версии). В серии Qwen3 Embedding есть модели 0.6B, 4B, 8B.
Ценообразование (OpenRouter)
Входные токены — $0.02 за 1M.
Сценарии использования
семантический поиск, поиск по коду, классификация текстов, кластеризация, двуязычное извлечение, RAG-системы.



