Arcee AI Trinity-Large-Thinking — это флагманская модель искусственного интеллекта нового поколения от стартапа Arcee AI, выпущенная 1 апреля 2026 года. Модель представляет собой рассуждающий (reasoning) вариант семейства Trinity-Large и построена на разреженной архитектуре Mixture-of-Experts (MoE) с 398 миллиардами параметров (из которых активно ~13 млрд на токен). Это одна из крупнейших открытых моделей, когда-либо выпущенных американским стартапом. Официальный сайт: https://www.arcee.ai.
Arcee AI — это команда из 26 человек в Сан-Франциско, которая потратила девять месяцев на создание полного семейства моделей с открытыми весами. Trinity-Large-Thinking создавалась с конкретной целью — обеспечить производительность на уровне лучших проприетарных моделей при цене примерно на 96% ниже. В первые два месяца семейство Trinity обслужило более 3,4 триллиона токенов на OpenRouter, став самой используемой открытой моделью в США.
Ключевое отличие модели — явные цепочки рассуждений (chain-of-thought), которые генерируются внутри специальных блоков
Архитектура и принцип работы
Trinity-Large-Thinking построена на архитектуре Sparse MoE (AfmoeForCausalLM) с 256 экспертами, из которых активно только 4 на токен — коэффициент разреженности составляет всего 1,56%. Такая конструкция делает модель значительно более разреженной, чем большинство конкурирующих MoE-моделей, и обеспечивает в 2–3 раза более высокую пропускную способность инференса по сравнению с плотными моделями аналогичного размера. Среди ключевых архитектурных инноваций: перемежающееся локальное и глобальное внимание с gated-слоями внимания, depth-scaled sandwich norm и сигмоидная маршрутизация, 6 плотных слоёв для стабильности маршрутизации, SMEBU (Soft-clamped Momentum Expert Bias Updates) — собственный механизм балансировки нагрузки.
Контекстное окно
Модель обладает контекстным окном в 512 000 токенов. Это позволяет обрабатывать длиннейшие цепочки рассуждений на протяжении многих агентных шагов. В API Arcee модель обслуживается с контекстом 256K.
Предобучение
Pretraining-запуск модели потребовал 17 триллионов токенов за 33 дня на 2 048 GPU NVIDIA B300 — это крупнейший публично подтверждённый B300-тренировочный запуск на сегодняшний день. В обучении использовался оптимизатор Muon, и процесс завершился без единого всплеска потерь (zero loss spikes). Курация данных выполнялась в партнёрстве с компанией Datology.
Токенизатор и форматы
Модель генерирует явные токены рассуждений в блоках
Аппаратные требования
Для самостоятельного развертывания рекомендуется vLLM 0.11.1 или новее.
Дата выхода и версии
Релиз — 1 апреля 2026 года. Семейство Trinity Large включает: Trinity-Large-TrueBase (промежуточный чекпоинт после 10T токенов), Trinity-Large-Base (полная foundation-модель на 17T токенов), Trinity-Large-Preview (лёгкая instruct-модель, январь 2026), Trinity-Large-Thinking (рассуждающая версия). В мае 2026 года выпущена FP8-квантованная версия.
Ценообразование
Входные токены — $0.25 за 1M, выходные — $0.90 за 1M. Это примерно на 96% дешевле, чем Anthropic Opus-4.6. Доступна через Arcee API, OpenRouter, Vercel AI Gateway, DigitalOcean Agentic Inference Cloud.
Сценарии использования
агентные системы, многошаговые рассуждения, RAG и длинные документы.



