InclusionAI Ring-2.6-1T — Триллионная модель рассуждений

Ring-2.6-1T — это флагманская триллионпараметровая модель рассуждений (reasoning model) от китайской компании InclusionAI (подразделение Ant

Вступление

Ring-2.6-1T — это флагманская триллионпараметровая модель рассуждений (reasoning model) от китайской компании InclusionAI (подразделение Ant Group), предназначенная для решения сложных задач в реальных агентных (Agent) и корпоративных сценариях. В отличие от многих современных моделей, которые гонятся за чистым приростом параметров, Ring-2.6-1T создавалась как инструмент для выполнения, а не просто для ответов на вопросы. Её ключевая философия — переход от «умения отвечать» к «умению исполнять»: планировать шаги, вызывать инструменты, корректировать ошибки и удерживать контекст на длинных горизонтах задач.

Модель является частью семейства Ling & Ring 2.6, которое включает три открытых веса: Ling-2.6-flash (мгновенный ответ), Ling-2.6-1T (универсальная мощность) и Ring-2.6-1T (глубокое рассуждение и агентные сценарии). Ring-2.6-1T позиционируется как «мозг» для продвинутых кодинг-агентов, сложных конвейеров рассуждений и крупномасштабных автономных систем, где качество исполнения, задержка и стоимость имеют решающее значение. Её главная «фишка» — механизм регулируемого усилия рассуждения (Reasoning Effort), позволяющий разработчикам динамически выбирать между скоростью и глубиной мышления в зависимости от сложности задачи.

Технические характеристики

Архитектура и параметры

Ring-2.6-1T построена на архитектуре BailingMoeV2_5ForCausalLM с гибридной схемой bailing_hybrid. Модель имеет общий объём параметров в ~1 триллион (1T), однако благодаря архитектуре разреженных экспертов (MoE) на каждый токен активируется всего ~63 миллиарда. В состав архитектуры входят 80 скрытых слоёв, 256 маршрутизируемых экспертов, из которых на каждый токен выбирается 8 экспертов.

Гибридное внимание: «пересадка сердца»

Ключевое техническое новшество модели — гибридный стек внимания, сочетающий Lightning Attention (линейное внимание) и MLA (Multi-head Latent Attention / многоголовое латентное внимание) в пропорции 7:1. Такая архитектура решает проблему квадратичной сложности традиционного внимания: Lightning Attention снижает вычислительные затраты с O(n²) до O(n), а MLA сжимает объёмный KV-кэш в низкоранговое латентное пространство. Это критически важно для длинных контекстов: при длине свыше 32K токенов внимание потребляет более 60% всех FLOPs, а на 256K становится абсолютным узким местом. Пропорция 7:1 была выбрана эмпирически как оптимальный баланс между эффективностью и качеством.

Важно отметить, что InclusionAI не переобучала модель с нуля, а провела «пересадку сердца» — плавную четырёхступенчатую миграцию уже обученной триллионпараметровой модели на новую гибридную архитектуру внимания, затратив около 400B токенов на дообучение.

Контекстное окно

Нативная длина контекста модели составляет 128K токенов, однако с применением метода YaRN (Yet another RoPE extensioN) контекст может быть расширен до 256K. Это позволяет обрабатывать объёмные документы и многошаговые агентные сценарии.

Форматы весов и квантование

Модель распространяется в FP8 (E4M3 compressed-tensors) — формате сжатия, оптимизированном для эффективного инференса. Веса представлены в виде 175 больших shard-файлов safetensors.

Лицензия и доступность

Модель распространяется под свободной лицензией MIT. Веса доступны для скачивания как на Hugging Face, так и на ModelScope (для пользователей из Китая).

Требования к оборудованию

Для развёртывания модели требуются значительные вычислительные ресурсы:

  • GB300 × 4 GPU--tp-size 4, --mem-fraction-static 0.95 (~238.5 ГБ/GPU)
  • B200 × 8 GPU--tp-size 8, --mem-fraction-static 0.8
  • H200 × 8 GPU--tp-size 8, --mem-fraction-static 0.95

Для запуска рекомендуется использовать SGLang или vLLM с поддержкой гибридной архитектуры Bailing. Обязателен флаг --trust-remote-code из-за кастомной реализации.

Дата выхода и версии

Дата официального анонса: 9 мая 2026 года.
Дата открытого релиза (Open Source): 15 мая 2026 года — в этот день веса модели стали доступны на Hugging Face.

Семейство моделей Ling & Ring 2.6:

  • Ling-2.6-flash — мгновенный ответ, низкая задержка, высокий throughput, ~104B
  • Ling-2.6-1T — универсальная мощность, высокая плотность знаний, ~1T
  • Ring-2.6-1T — глубокое рассуждение, агентные сценарии, ~1T (63B активных)

Предшественники: Модель базируется на предыдущем поколении Ling-2.0-1T, которое уже было обучено на 20T токенов. Ring-2.6 стала эволюционным шагом, сфокусированным не на переобучении с нуля, а на архитектурной оптимизации и пост-тренировочном улучшении агентных способностей.

Технический отчёт: 25 июня 2026 года был опубликован подробный технический отчёт на arXiv (2606.15079).

Дополнительные сведения

Механизм Reasoning Effort: high и xhigh

Главная инновация модели — возможность регулировать «глубину мышления»:

  • high mode — ориентирован на высокочастотные агентные рабочие процессы: минимальные накладные расходы на токены, быстрая многозадачность, подходит для многооборотных диалогов, совместной работы с инструментами, декомпозиции задач и производственных вызовов по умолчанию.
  • xhigh mode — предназначен для математических олимпиад, научных исследований, сложного логического анализа и многовариантного поиска решений, предоставляя максимальное пространство для размышлений.

В SGLang для вызова high-режима используется параметр reasoning_effort: "high" в OpenAI-совместимом API, а xhigh передаётся через chat_template_kwargs.reasoning_effort.

Производительность в бенчмарках

Ring-2.6-1T демонстрирует выдающиеся результаты в реальных агентных сценариях:

Бенчмарк Режим Результат Сравнение
PinchBench high 87.60 Выше GPT-5.4 xHigh, Gemini-3.1-Pro high, Claude-Opus-4.7 xhigh
ClawEval high 63.82 Входит в число лучших сопоставимых моделей
Tau2-Bench (Telecom) high 95.32 Отставание от лидера менее 1 балла
ARC-AGI-V2 xhigh 77.78 На уровне Gemini-3.1-Pro high и Claude-Opus-4.7 xhigh
AIME 26 xhigh 95.83 Наравне с DeepSeek V4 Pro Max
GPQA Diamond xhigh 88.27 Высокий уровень научных знаний

Доступность и стоимость

Модель доступна через OpenRouter с 8 мая 2026 года. По данным Artificial Analysis, Ring-2.6-1T демонстрирует скорость вывода 132.4 токенов/сек при задержке до первого токена 18.49 секунд. Смешанная цена составляет $0.52 за 1M токенов.

Поддержка инструментов и парсинг

Модель нативно поддерживает вызов инструментов (tool calls) в формате XML с тегами <arg_key> и <arg_value>. Для корректной работы в SGLang рекомендуется использовать --tool-call-parser glm и --reasoning-parser deepseek-r1 для выделения блоков <think>...</think> в отдельное поле message.reasoning_content.

Экосистема и значимость

Ring-2.6-1T — это не просто очередная SOTA-модель, а пример прагматичного инженерного подхода: вместо того чтобы сжигать сотни миллионов долларов на обучение нового триллионного гиганта, InclusionAI модернизировала уже существующую модель, сделав её эффективнее для реальных агентных задач. Открытие всех трёх весов семейства Ling & Ring 2.6 под лицензией MIT делает их доступными для широкого сообщества разработчиков, исследователей и предприятий.

Официальный сайт: https://huggingface.co/inclusionai/Ring-2.6-1T

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *