Вступление
Nex-N2-mini — это открытая агентная мультимодальная модель с гибридной архитектурой разреженных экспертов (MoE), разработанная консорциумом Nex AGI (инициатива Шанхайского института креативных технологий). Модель позиционируется как младшая версия в семействе Nex-N2, ориентированная на баланс между качеством ответов и задержкой. Её ключевая особенность — фреймворк Agentic Thinking, который объединяет рассуждение, использование инструментов и обратную связь от среды в единый замкнутый цикл, а не обрабатывает их как отдельные этапы.
Nex-N2-mini создана на основе Qwen3.5-35B-A3B-Base и предназначена для решения сложных долгосрочных агентных задач: агентного программирования, глубокого исследования, вызова инструментов и выполнения команд в терминале. Модель поддерживает ввод как текста, так и изображений, что делает её универсальным инструментом для реальных сценариев продуктивности — от разработки игр до веб- и мультимодальной генерации.
Технические характеристики
Архитектура и параметры
Nex-N2-mini построена на архитектуре Qwen3_5MoeForConditionalGeneration с общим количеством параметров ~35 млрд (35.1 млрд), из которых на каждый токен активируется всего ~3 млрд. Модель использует 256 экспертов с маршрутизацией 8 активных + 1 общий эксперт на токен. Скрытый размер — 2048.
Гибридное внимание
Архитектура включает 40 слоёв с гибридной схемой: 3 слоя Gated DeltaNet (линейное внимание) чередуются с 1 слоем полного внимания в каждой группе. Такой подход обеспечивает эффективную обработку длинных контекстов при сохранении качества рассуждений.
Контекстное окно и словарь
Модель поддерживает контекстное окно размером 262 144 токена, что позволяет обрабатывать объёмные документы и сложные многошаговые задачи. Размер словаря — 248 320 токенов.
Мультимодальность
Встроенный ViT-энкодер (Vision Transformer) состоит из 27 блоков со скрытой размерностью 1152 и размером патча 16×16. Это позволяет модели обрабатывать изображения наравне с текстом.
Режим рассуждений
Модель является рассуждающей (reasoning model) и генерирует вывод в блоках <think>...</think>. Это обеспечивает прозрачность процесса принятия решений и упрощает отладку агентных систем.
Лицензия и доступность
Модель распространяется под лицензией Apache 2.0. Веса доступны для скачивания с Hugging Face, что позволяет запускать модель локально.
Дата выхода и версии
Дата официального релиза: 11 июня 2026 года — в этот день Nex AGI официально анонсировала и открыла исходные коды модели Nex-N2.
Семейство моделей Nex-N2 включает две версии:
- Nex-N2-Pro — основа Qwen3.5-397B-A17B, ~397B (17B активных)
- Nex-N2-mini — основа Qwen3.5-35B-A3B-Base, ~35B (3B активных)
Предшественник: Nex-N1 (релиз — декабрь 2025 года), который также был агентной моделью, но Nex-N2 значительно превосходит его по производительности в реальных агентных задачах.
Важное примечание: В публичном релизе отсутствуют веса MTP (Multi-Token Prediction), несмотря на то, что config.json содержит соответствующие записи. Это означает, что ускорение за счёт MTP недоступно в открытой версии.
Дополнительные сведения
Производительность в бенчмарках
Согласно официальным данным Nex AGI:
| Бенчмарк | Nex-N2-mini | Nex-N2-Pro | GPT-5.5 |
|---|---|---|---|
| BrowseComp | 74.1 | 83.7 | 84.4 |
| GDPval | 1402 | 1585 | 1769 |
| Toolathlon | 33.3 | 51.9 | 55.6 |
Nex-N2-Pro демонстрирует результаты, сопоставимые с топовыми моделями, такими как GPT-5.5 и Opus 4.7, особенно выделяясь в задачах программирования (75.3 на Terminal-Bench 2.1).
Доступность и стоимость
Модель доступна через AI/ML API и OpenRouter. Цены на OpenRouter: $0.025 / $0.10 за 1M токенов (ввод/вывод). Благодаря кэшированию промптов эффективная стоимость может быть на 60–80% ниже.
Локальный запуск
Для локального использования доступны GGUF-квантования:
- F16 — 64.6 GB (полная точность)
- Q8_0 — 34.4 GB (почти без потерь)
- Q6_K — 26.6 GB (очень высокое качество)
- Q5_K_M — 23.0 GB (высокое качество)
- Q4_K_M — 19.7 GB (лучший баланс)
- IQ3_XXS — 13.6 GB (минимальный размер)
Также доступна NVFP4-версия, оптимизированная для NVIDIA Blackwell, и MLX-квантования для Apple Silicon.
Требования к оборудованию: для 8-битной MLX-версии требуется ~37 ГБ памяти во время инференса. Минимальный GGUF-квант (IQ3_XXS) помещается в 15 ГБ видеопамяти.
Инструменты и совместимость
Для запуска требуется llama.cpp от 10 февраля 2026 года (поддержка архитектуры qwen35moe). Модель совместима с Ollama 0.19+, LM Studio и Transformers. Поддерживается вызов инструментов без дополнительной настройки.
Экосистема
Проект Nex AGI активно развивается: сообщество создаёт различные квантования (APEX, Unsloth-style UD) и модификации (например, аблатерованные «uncensored» версии). Nex-N2-mini доступна в OpenRouter с 24 июня 2026 года.
Официальный сайт: https://huggingface.co/nex-agi/nex-n2-mini



