Nex-AGI Nex-N2-mini — Агентная мультимодальная модель

Nex-N2-mini — это открытая агентная мультимодальная модель с гибридной архитектурой разреженных экспертов (MoE), разработанная консорциумом

Вступление

Nex-N2-mini — это открытая агентная мультимодальная модель с гибридной архитектурой разреженных экспертов (MoE), разработанная консорциумом Nex AGI (инициатива Шанхайского института креативных технологий). Модель позиционируется как младшая версия в семействе Nex-N2, ориентированная на баланс между качеством ответов и задержкой. Её ключевая особенность — фреймворк Agentic Thinking, который объединяет рассуждение, использование инструментов и обратную связь от среды в единый замкнутый цикл, а не обрабатывает их как отдельные этапы.

Nex-N2-mini создана на основе Qwen3.5-35B-A3B-Base и предназначена для решения сложных долгосрочных агентных задач: агентного программирования, глубокого исследования, вызова инструментов и выполнения команд в терминале. Модель поддерживает ввод как текста, так и изображений, что делает её универсальным инструментом для реальных сценариев продуктивности — от разработки игр до веб- и мультимодальной генерации.

Технические характеристики

Архитектура и параметры

Nex-N2-mini построена на архитектуре Qwen3_5MoeForConditionalGeneration с общим количеством параметров ~35 млрд (35.1 млрд), из которых на каждый токен активируется всего ~3 млрд. Модель использует 256 экспертов с маршрутизацией 8 активных + 1 общий эксперт на токен. Скрытый размер — 2048.

Гибридное внимание

Архитектура включает 40 слоёв с гибридной схемой: 3 слоя Gated DeltaNet (линейное внимание) чередуются с 1 слоем полного внимания в каждой группе. Такой подход обеспечивает эффективную обработку длинных контекстов при сохранении качества рассуждений.

Контекстное окно и словарь

Модель поддерживает контекстное окно размером 262 144 токена, что позволяет обрабатывать объёмные документы и сложные многошаговые задачи. Размер словаря — 248 320 токенов.

Мультимодальность

Встроенный ViT-энкодер (Vision Transformer) состоит из 27 блоков со скрытой размерностью 1152 и размером патча 16×16. Это позволяет модели обрабатывать изображения наравне с текстом.

Режим рассуждений

Модель является рассуждающей (reasoning model) и генерирует вывод в блоках <think>...</think>. Это обеспечивает прозрачность процесса принятия решений и упрощает отладку агентных систем.

Лицензия и доступность

Модель распространяется под лицензией Apache 2.0. Веса доступны для скачивания с Hugging Face, что позволяет запускать модель локально.

Дата выхода и версии

Дата официального релиза: 11 июня 2026 года — в этот день Nex AGI официально анонсировала и открыла исходные коды модели Nex-N2.

Семейство моделей Nex-N2 включает две версии:

  • Nex-N2-Pro — основа Qwen3.5-397B-A17B, ~397B (17B активных)
  • Nex-N2-mini — основа Qwen3.5-35B-A3B-Base, ~35B (3B активных)

Предшественник: Nex-N1 (релиз — декабрь 2025 года), который также был агентной моделью, но Nex-N2 значительно превосходит его по производительности в реальных агентных задачах.

Важное примечание: В публичном релизе отсутствуют веса MTP (Multi-Token Prediction), несмотря на то, что config.json содержит соответствующие записи. Это означает, что ускорение за счёт MTP недоступно в открытой версии.

Дополнительные сведения

Производительность в бенчмарках

Согласно официальным данным Nex AGI:

Бенчмарк Nex-N2-mini Nex-N2-Pro GPT-5.5
BrowseComp 74.1 83.7 84.4
GDPval 1402 1585 1769
Toolathlon 33.3 51.9 55.6

Nex-N2-Pro демонстрирует результаты, сопоставимые с топовыми моделями, такими как GPT-5.5 и Opus 4.7, особенно выделяясь в задачах программирования (75.3 на Terminal-Bench 2.1).

Доступность и стоимость

Модель доступна через AI/ML API и OpenRouter. Цены на OpenRouter: $0.025 / $0.10 за 1M токенов (ввод/вывод). Благодаря кэшированию промптов эффективная стоимость может быть на 60–80% ниже.

Локальный запуск

Для локального использования доступны GGUF-квантования:

  • F16 — 64.6 GB (полная точность)
  • Q8_0 — 34.4 GB (почти без потерь)
  • Q6_K — 26.6 GB (очень высокое качество)
  • Q5_K_M — 23.0 GB (высокое качество)
  • Q4_K_M — 19.7 GB (лучший баланс)
  • IQ3_XXS — 13.6 GB (минимальный размер)

Также доступна NVFP4-версия, оптимизированная для NVIDIA Blackwell, и MLX-квантования для Apple Silicon.

Требования к оборудованию: для 8-битной MLX-версии требуется ~37 ГБ памяти во время инференса. Минимальный GGUF-квант (IQ3_XXS) помещается в 15 ГБ видеопамяти.

Инструменты и совместимость

Для запуска требуется llama.cpp от 10 февраля 2026 года (поддержка архитектуры qwen35moe). Модель совместима с Ollama 0.19+, LM Studio и Transformers. Поддерживается вызов инструментов без дополнительной настройки.

Экосистема

Проект Nex AGI активно развивается: сообщество создаёт различные квантования (APEX, Unsloth-style UD) и модификации (например, аблатерованные «uncensored» версии). Nex-N2-mini доступна в OpenRouter с 24 июня 2026 года.

Официальный сайт: https://huggingface.co/nex-agi/nex-n2-mini

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *