Сервис развивается: тестируем формат, собираем идеи, улучшаем сервис. Есть идеи?

Написать
Войти
Дайджесты
Иллюстрация к статье

Qwen 3.8 Max: 2,4 триллиона параметров от Alibaba в действии на 23 игровых бенчмарках

Alibaba анонсировала превью-версию супермодели Qwen 3.8 Max на 2,4 трлн параметров. Анализируем архитектуру Mixture of Experts, мультимодальную обработку видео и результаты 23 независимых тестов GoldyBench против моделей Fable 5, GPT-5.6 и Kimi K3 в генерации интерактивного UI и 3D-графики.

Qwen 3.8 Max: 2,4 триллиона параметров от Alibaba в действии на 23 игровых бенчмарках

Подразделение Alibaba Cloud объявило о выходе закрытой превью-версии своей новой флагманской языковой модели Qwen 3.8 Max. Общий масштаб системы оценивается в 2,4 триллиона параметров, что делает ее одним из крупнейших нейросетевых комплексов в мире. Модель построена на архитектуре Mixture of Experts (MoE) — смеси специализированных экспертных подсетей, из которых при обработке конкретного запроса активируется лишь определенная часть.

Разработчики сделали акцент на нативной мультимодальности. Qwen 3.8 Max напрямую работает с видеопотоком высокой четкости, аудиозаписями, техническими чертежами и сложными PDF-документами, содержащими графики и таблицы. Системное контекстное окно модели расширено для одновременной обработки большого массива мультимедийных файлов.

Архитектура Mixture of Experts и мультимодальный вход

Концепция Mixture of Experts (MoE) позволяет существенно оптимизировать вычислительные затраты при эксплуатации гигантских нейросетей. В отличие от плотных (dense) моделей, где при каждом запросе задействуются абсолютно все веса, MoE-архитектура динамически направляет входные токены к наиболее подходящим внутренним экспертам.

В Qwen 3.8 Max этот подход позволил добиться высокой скорости вывода при огромном общем размере параметров. Мультимодальный слой нейросети интегрирован на уровне внутренних представлений (embeddings), благодаря чему модель может воспринимать видеокадры в реальном времени, сопоставляя происходящее на экране с пользовательскими инструкциями и наборами правил.

Сравнительный бенчмарк GoldyBench из 23 интерактивных игр

Чтобы проверить заявления разработчиков, исследователи провели серию комплексных испытаний по методологии GoldyBench. Этот тестовый набор состоит из 23 практических заданий по генерации сложного веб-кода, 3D-графики на WebGL и браузерных интерактивных симуляторов. Модель Qwen 3.8 Max сравнивалась с главными конкурентами — Claude Fable 5, GPT-5.6 Sol и Kimi K3.

Тестовые сценарии включали создание следующих интерактивных приложений:

  • Двухмерные аркады в стиле Outrun с ретро-графикой и управлением клавиатурой.
  • Трехмерные ролевые сценарии в духе Skyrim с процедурной генерацией ландшафта.
  • Полетные симуляторы и авиационные симуляторы посадки на полосу.
  • Пространственные симуляторы в стиле GTA с видом сверху и физикой автомобилей.
  • Браузерный 3D-экшен с заимствованием механик Doom и классических шутеров.
  • Сложные физические модели взаимодействия твердых тел и частиц.
  • Адаптивные посадочные страницы с динамической визуализацией элементов интерфейса.

Результаты сравнительного анализа выявили четкие сильные и слабые стороны Qwen 3.8 Max.

В задачах по созданию веб-страниц, коммерческих лендингов и художественного визуального оформления модель от Alibaba показала впечатляющий уровень. Верстка получалась современной, адаптивной, с эстетичной типографикой и плавными переходами. В визуальном оформлении UI модель обошла конкурентов за счет внимания к деталям стиля.

Однако при создании сложной игровой логики и обработке пользовательского ввода выявились ограничения. В 3D-симуляторах и играх Qwen 3.8 Max уступила Kimi K3 и Fable 5 по точности расчета физических столкновений, плавности работы камеры и отклику персонажей на нажатия клавиш. Если Kimi K3 генерировала строгий, математически просчитанный код движения, то Qwen 3.8 Max чаще допускала визуальные баги в физике объектов.

Рыночный контекст и регулирование моделей

Выход Qwen 3.8 Max и Kimi K3 происходил на фоне активных дискуссий между технологическими аналитиками Симоном Уилисоном и Беном Томпсоном. Эксперты обсуждают политику американского регулирования в отношении дистилляции ИИ-моделей — практики, когда небольшие нейросети обучаются на синтетических ответах более крупных флагманских систем.

В США предлагаются меры по ограничению экспорта закрытых весов и усилению контроля за использованием выходов проприетарных моделей. На этом фоне стратегия китайских технологических гигантов, регулярно выкладывающих в открытый доступ семейства моделей Qwen и Kimi, кардинально меняет мировой ландшафт разработок, предоставляя независимым инженерам мощные инструменты без привязки к западным облачным провайдерам.

Доступность и варианты подключения

На данный момент Qwen 3.8 Max доступна в режиме ограниченного закрытого превью через платформы Coder и Coder Work. Провайдеры предоставляют доступ к API по тарифам с оплатой за миллион токенов, а также в рамках расширенных корпоративных пакетов.

Инженерам рекомендуется использовать Qwen 3.8 Max для задач аналитической обработки видео, разбора сложных документов и автоматического проектирования интерфейсов, а для построения строгой игровой логики и математических расчетов комбинировать ее с моделями вроде Kimi K3.

По мере развертывания мультимодальных фреймворков нового поколения разработчики получают доступ к сквозному автоматизированному проектированию. Взаимодействие с нейросетями переходит от банальной текстовой подсказательной механики к комплексной генерации сложных динамических сред, где код верстки, серверная логика и трехмерный рендеринг формируются единым непрерывным потоком. Для бизнеса это означает кардинальное сокращение сроков проверки продуктовых гипотез и возможность создавать демонстрационные прототипы сложных цифровых продуктов за считанные часы вместо недель командной разработки.

Дополнительный интерес представляет сопоставление ресурсоемкости различных архитектурных решений. Использование подсетей экспертов MoE сокращает количество активных параметров при вычислении каждого токена до приемлемого уровня, что дает возможность обрабатывать длительные потоки мультимедийных данных на стандартном оборудовании. Интеграция подобных моделей в коммерческие продукты снижает издержки на инфраструктуру при вызове сложных визуальных и аналитических команд. Практические тесты демонстрируют, что грамотный выбор профиля модели для конкретной подзадачи является залогом финансовой эффективности ИИ-проекта.