Яндекс.Метрика
Услуги Портфолио Контакты БлогНовости +7 (800) 511‑32‑27 Обсудить проект
ИИ и LLM

Alibaba выпустила открытые веса Qwen3.8-Max: 2,4 трлн параметров доступны для самохостинга

24 августа 2026·7 мин чтения
Qwen3.8-MaxOpen Weights
Alibaba выпустила открытые веса Qwen3.8-Max

Коротко о главном

12 августа 2026 года команда Qwen (Alibaba) опубликовала открытые веса флагманской модели Qwen3.8-Max на Hugging Face и ModelScope. Модель насчитывает 2,4 трлн параметров при архитектуре Mixture of Experts (MoE) с ≈95 млрд активных параметров на запрос — это крупнейшая open-source LLM, доступная для самостоятельного развёртывания. На агентных бенчмарках она превосходит GPT-5.6 Sol Max и вплотную подбирается к Claude Fable 5.

Для команд, которые встраивают LLM в продукты или оценивают возможность разработки AI/ML-решений на собственной инфраструктуре, Qwen3.8-Max — первая модель класса Max, которую можно скачать и запустить без зависимости от стороннего API.

Хронология релиза

3 августа 2026 года Alibaba запустила Qwen3.8-Max через API: QwenCloud и Alibaba Cloud Model Studio, стоимость $2/$6 за 1 млн входящих/исходящих токенов. Модель поддерживала мультимодальный ввод (текст, изображения, видео) и контекстное окно до 1 млн токенов.

12 августа команда выпустила открытые веса под названием Qwen3.8-2.4T-A95B. Открытая версия работает только с текстом, требует обязательного режима мышления (thinking) и распространяется по кастомной лицензии Qwen3.8-Max License — не Apache 2.0. Одновременно вышли веса модели меньшего размера Qwen3.8-27B (14 августа, на Alibaba ModelScope), которая ориентирована на кодинг и агентные задачи.

Архитектура и характеристики

Qwen3.8-Max — разреженная MoE-модель: при суммарных 2,4 трлн параметров активируется лишь ≈95 млрд на каждый запрос. Это позволяет достигать качества фронтирных плотных моделей при значительно меньших вычислительных затратах на инференс по сравнению с плотной моделью аналогичного размера.

API-версия поддерживает контекст до 1 млн токенов (~750 000 слов) и мультимодальный ввод. Открытые веса доступны в формате FP8 для эффективного самохостинга, однако без мультимодальности и с обязательным включённым «режимом мышления» — модель всегда генерирует цепочку рассуждений перед итоговым ответом.

Результаты бенчмарков

По данным команды Qwen и независимых тестов на момент публикации:

  • OSWorld-Verified: 86,1 балла — выше GPT-5.6 Sol Max (83,2) и Claude Fable 5 (85,0), уступает только Gemini 3.1 Ultra в отдельных конфигурациях.
  • PaperBench (воспроизведение научных результатов): 93,0 — наивысший публично задокументированный результат среди всех моделей.
  • LM Arena Leaderboard: 4-е место в общем зачёте; 2-я среди open-weight моделей (после Kimi K3).
  • SWE-Bench Pro (агентные задачи кодирования): входит в топ-3 среди всех моделей.

Важная оговорка: бенчмарки зафиксированы на момент первых дней после релиза. Результаты на открытых весах могут отличаться от API-версии в зависимости от конфигурации инференса.

Что это значит для команд разработки

Выход открытых весов Qwen3.8-Max меняет экономику самохостинга frontier-моделей. До этого момента модели класса Max (сопоставимые с коммерческими фронтирными LLM по качеству) были доступны только через API с фиксированным ценообразованием и без контроля над инфраструктурой. Теперь команды с достаточными GPU-ресурсами получают три практических преимущества.

Первое — независимость от вендора. Компании, обрабатывающие чувствительные данные в закрытых контурах (финтех, медтех, enterprise), смогут запускать frontier-качество без передачи данных в сторонние облака.

Второе — предсказуемые затраты. При высоком объёме токенов собственный хостинг экономичнее API. FP8-чекпоинты снижают требования к VRAM по сравнению с FP16-форматом.

Третье — fine-tuning без ограничений лицензии (в пределах условий Qwen3.8-Max License). Команды могут дообучать модель на собственных данных — в рамках AI/ML разработки. Однако перед использованием в коммерческих продуктах необходимо изучить условия лицензии: она нестандартная и может накладывать ограничения на размещение и деривативы.

Параллельно стоит учитывать конкурентный контекст: на той же неделе Kimi K3 (2,8 трлн параметров) также присутствовал в топе open-weight таблиц. Рынок открытых frontier-моделей насыщается быстро, и выбор конкретной архитектуры для продукта теперь требует регулярного пересмотра.

Как оценить применимость для вашей задачи

Прежде чем переходить к самохостингу Qwen3.8-Max, стоит проверить несколько условий. Во-первых, ваша задача требует именно frontier-качества (агентные сценарии, сложный кодинг, научные расчёты), а не базовый RAG или классификацию, где достаточны модели на 7–70B параметров. Во-вторых, у вашей инфраструктурной команды есть опыт развёртывания LLM на нескольких GPU-узлах. В-третьих, вы готовы обеспечить соответствие лицензионным условиям Qwen3.8-Max.

Если ни одно из условий не выполнено — рациональнее начать с API Qwen3.8-Max или аналогов, а переход на самохостинг рассматривать при масштабировании. Если требуется помощь с выбором архитектуры LLM-решения и проектированием инфраструктуры, AI/ML-разработка под ключ — профильное направление YuSMP Group.

Часто задаваемые вопросы

Можно ли использовать Qwen3.8-Max в коммерческом продукте? Да, но условия регулируются кастомной лицензией Qwen3.8-Max License, а не стандартной Apache 2.0. Перед коммерческим использованием или созданием деривативных моделей изучите её ограничения — они отличаются от прежних релизов Qwen.

Чем открытые веса отличаются от API? Открытая версия Qwen3.8-2.4T-A95B работает только с текстом, без видео/изображений и без контекстного окна 1M токенов (ограничения определяются конфигурацией при развёртывании). API-версия мультимодальная с полным 1M-контекстом.

Какое железо нужно для инференса? MoE-архитектура с 95B активными параметрами требует значительно меньше VRAM на запрос, чем плотная модель того же размера. FP8-чекпоинты доступны на Hugging Face. Точные требования зависят от batch-size и длины контекста — ориентируйтесь на рекомендации команды Qwen в документации модели.

Насколько актуальны бенчмарки? Цифры зафиксированы на момент релиза 12–14 августа 2026 года. LLM-экосистема обновляется еженедельно; для актуального сравнения используйте live-таблицы BenchLM или LM Arena.

Источники

MarkTechPost — Alibaba Qwen Releases Qwen3.8-Max: A 2.4 Trillion Parameter MoE Model and the Most Capable One in the Qwen Family to Date, 3 августа 2026 года.

The Decoder — Alibaba's open-weight Qwen3.8-Max takes on long-horizon AI tasks with 2.4 trillion parameters, август 2026 года.

LLM-Stats / Explainx.ai — Qwen3.8-Max Open Weights Are Live (August 2026), 12 августа 2026 года.

Встраиваете LLM в продукт или оцениваете переход на self-hosted модели?

YuSMP Group помогает командам с выбором архитектуры, развёртыванием и дообучением языковых моделей — от прототипа до production-контура.

Обсудить AI/ML-разработку
Материал подготовлен редакцией YuSMP Group по открытым источникам. Нужна экспертиза по теме или разработка под задачу — обсудим проект.