Вступление
Ring-2.6-1T — это флагманская триллионпараметровая модель рассуждений (reasoning model) от китайской компании InclusionAI (подразделение Ant Group), предназначенная для решения сложных задач в реальных агентных (Agent) и корпоративных сценариях. В отличие от многих современных моделей, которые гонятся за чистым приростом параметров, Ring-2.6-1T создавалась как инструмент для выполнения, а не просто для ответов на вопросы. Её ключевая философия — переход от «умения отвечать» к «умению исполнять»: планировать шаги, вызывать инструменты, корректировать ошибки и удерживать контекст на длинных горизонтах задач.
Модель является частью семейства Ling & Ring 2.6, которое включает три открытых веса: Ling-2.6-flash (мгновенный ответ), Ling-2.6-1T (универсальная мощность) и Ring-2.6-1T (глубокое рассуждение и агентные сценарии). Ring-2.6-1T позиционируется как «мозг» для продвинутых кодинг-агентов, сложных конвейеров рассуждений и крупномасштабных автономных систем, где качество исполнения, задержка и стоимость имеют решающее значение. Её главная «фишка» — механизм регулируемого усилия рассуждения (Reasoning Effort), позволяющий разработчикам динамически выбирать между скоростью и глубиной мышления в зависимости от сложности задачи.
Технические характеристики
Архитектура и параметры
Ring-2.6-1T построена на архитектуре BailingMoeV2_5ForCausalLM с гибридной схемой bailing_hybrid. Модель имеет общий объём параметров в ~1 триллион (1T), однако благодаря архитектуре разреженных экспертов (MoE) на каждый токен активируется всего ~63 миллиарда. В состав архитектуры входят 80 скрытых слоёв, 256 маршрутизируемых экспертов, из которых на каждый токен выбирается 8 экспертов.
Гибридное внимание: «пересадка сердца»
Ключевое техническое новшество модели — гибридный стек внимания, сочетающий Lightning Attention (линейное внимание) и MLA (Multi-head Latent Attention / многоголовое латентное внимание) в пропорции 7:1. Такая архитектура решает проблему квадратичной сложности традиционного внимания: Lightning Attention снижает вычислительные затраты с O(n²) до O(n), а MLA сжимает объёмный KV-кэш в низкоранговое латентное пространство. Это критически важно для длинных контекстов: при длине свыше 32K токенов внимание потребляет более 60% всех FLOPs, а на 256K становится абсолютным узким местом. Пропорция 7:1 была выбрана эмпирически как оптимальный баланс между эффективностью и качеством.
Важно отметить, что InclusionAI не переобучала модель с нуля, а провела «пересадку сердца» — плавную четырёхступенчатую миграцию уже обученной триллионпараметровой модели на новую гибридную архитектуру внимания, затратив около 400B токенов на дообучение.
Контекстное окно
Нативная длина контекста модели составляет 128K токенов, однако с применением метода YaRN (Yet another RoPE extensioN) контекст может быть расширен до 256K. Это позволяет обрабатывать объёмные документы и многошаговые агентные сценарии.
Форматы весов и квантование
Модель распространяется в FP8 (E4M3 compressed-tensors) — формате сжатия, оптимизированном для эффективного инференса. Веса представлены в виде 175 больших shard-файлов safetensors.
Лицензия и доступность
Модель распространяется под свободной лицензией MIT. Веса доступны для скачивания как на Hugging Face, так и на ModelScope (для пользователей из Китая).
Требования к оборудованию
Для развёртывания модели требуются значительные вычислительные ресурсы:
- GB300 × 4 GPU —
--tp-size 4,--mem-fraction-static 0.95(~238.5 ГБ/GPU) - B200 × 8 GPU —
--tp-size 8,--mem-fraction-static 0.8 - H200 × 8 GPU —
--tp-size 8,--mem-fraction-static 0.95
Для запуска рекомендуется использовать SGLang или vLLM с поддержкой гибридной архитектуры Bailing. Обязателен флаг --trust-remote-code из-за кастомной реализации.
Дата выхода и версии
Дата официального анонса: 9 мая 2026 года.
Дата открытого релиза (Open Source): 15 мая 2026 года — в этот день веса модели стали доступны на Hugging Face.
Семейство моделей Ling & Ring 2.6:
- Ling-2.6-flash — мгновенный ответ, низкая задержка, высокий throughput, ~104B
- Ling-2.6-1T — универсальная мощность, высокая плотность знаний, ~1T
- Ring-2.6-1T — глубокое рассуждение, агентные сценарии, ~1T (63B активных)
Предшественники: Модель базируется на предыдущем поколении Ling-2.0-1T, которое уже было обучено на 20T токенов. Ring-2.6 стала эволюционным шагом, сфокусированным не на переобучении с нуля, а на архитектурной оптимизации и пост-тренировочном улучшении агентных способностей.
Технический отчёт: 25 июня 2026 года был опубликован подробный технический отчёт на arXiv (2606.15079).
Дополнительные сведения
Механизм Reasoning Effort: high и xhigh
Главная инновация модели — возможность регулировать «глубину мышления»:
- high mode — ориентирован на высокочастотные агентные рабочие процессы: минимальные накладные расходы на токены, быстрая многозадачность, подходит для многооборотных диалогов, совместной работы с инструментами, декомпозиции задач и производственных вызовов по умолчанию.
- xhigh mode — предназначен для математических олимпиад, научных исследований, сложного логического анализа и многовариантного поиска решений, предоставляя максимальное пространство для размышлений.
В SGLang для вызова high-режима используется параметр reasoning_effort: "high" в OpenAI-совместимом API, а xhigh передаётся через chat_template_kwargs.reasoning_effort.
Производительность в бенчмарках
Ring-2.6-1T демонстрирует выдающиеся результаты в реальных агентных сценариях:
| Бенчмарк | Режим | Результат | Сравнение |
|---|---|---|---|
| PinchBench | high | 87.60 | Выше GPT-5.4 xHigh, Gemini-3.1-Pro high, Claude-Opus-4.7 xhigh |
| ClawEval | high | 63.82 | Входит в число лучших сопоставимых моделей |
| Tau2-Bench (Telecom) | high | 95.32 | Отставание от лидера менее 1 балла |
| ARC-AGI-V2 | xhigh | 77.78 | На уровне Gemini-3.1-Pro high и Claude-Opus-4.7 xhigh |
| AIME 26 | xhigh | 95.83 | Наравне с DeepSeek V4 Pro Max |
| GPQA Diamond | xhigh | 88.27 | Высокий уровень научных знаний |
Доступность и стоимость
Модель доступна через OpenRouter с 8 мая 2026 года. По данным Artificial Analysis, Ring-2.6-1T демонстрирует скорость вывода 132.4 токенов/сек при задержке до первого токена 18.49 секунд. Смешанная цена составляет $0.52 за 1M токенов.
Поддержка инструментов и парсинг
Модель нативно поддерживает вызов инструментов (tool calls) в формате XML с тегами <arg_key> и <arg_value>. Для корректной работы в SGLang рекомендуется использовать --tool-call-parser glm и --reasoning-parser deepseek-r1 для выделения блоков <think>...</think> в отдельное поле message.reasoning_content.
Экосистема и значимость
Ring-2.6-1T — это не просто очередная SOTA-модель, а пример прагматичного инженерного подхода: вместо того чтобы сжигать сотни миллионов долларов на обучение нового триллионного гиганта, InclusionAI модернизировала уже существующую модель, сделав её эффективнее для реальных агентных задач. Открытие всех трёх весов семейства Ling & Ring 2.6 под лицензией MIT делает их доступными для широкого сообщества разработчиков, исследователей и предприятий.
Официальный сайт: https://huggingface.co/inclusionai/Ring-2.6-1T



