VibeCoderzVibeCoderz
Все статьи
2026/08/049 мин чтения

Qwen3.8-Max: 2.4 триллиона параметров за $6 выхода — и он уже в вашем iPhone в Китае

Alibaba Qwen Team выпустила Qwen3.8-Max — свою самую мощную модель. 2.4 триллиона параметров, мультимодальность, первое место в мире по PaperBench (воспроизведение научных работ), Vision Arena #2 — и цена в 4 раза ниже Claude Opus 5.

Содержание (12)+

Alibaba Qwen Team выпустила Qwen3.8-Max — свою самую мощную модель. 2.4 триллиона параметров, мультимодальность, первое место в мире по PaperBench (воспроизведение научных работ), Vision Arena #2 — и цена в 4 раза ниже Claude Opus 5.

Плюс: с 15 июля она уже работает как движок Apple Intelligence в Китае. Миллионы айфонов.

Но есть нюансы, которые важно понять до того, как бежать подключать API.

Qwen3.8-Max (3 августа 2026) — 2.4T параметров MoE, $2/$6 за 1M токенов, PaperBench 93.0 (первое место), Vision Arena #2, Frontend Code Arena #4. Открытые веса — «на следующей неделе». Qwen3.8-27B для домашнего железа — вместе с ними. В статье: архитектура, все бенчмарки, сравнение с Kimi K3 и западными моделями, нюанс с токенами, карта выбора.

Ссылки:


Для тех, кто только разбирается: что вообще происходит

Последние два года китайские AI-лаборатории выпускают модели, которые не уступают американским флагманам, но стоят в разы дешевле. Сначала DeepSeek. Потом Kimi. Теперь Qwen — семейство моделей от Alibaba, которое уже много лет развивается, но именно сейчас добралось до верхней лиги.

Qwen3.8-Max — не просто «ещё одна китайская модель». Это:

  • Самая большая модель Alibaba за всю историю (2.4 триллиона параметров — для сравнения, ChatGPT-4 был ~1.8T)
  • Первое место в мире по одному из важнейших бенчмарков — воспроизведению научных работ
  • Цена за выход в 4 раза ниже Claude Opus 5
  • Модель, которая уже встроена в Apple Intelligence в Китае

И через «следующую неделю» после выхода — обещают открытые веса. Первые в классе размером 2+ триллиона параметров.


Архитектура: 2.4 триллиона, но активных — только 95 миллиардов

Это то самое MoE — Mixture of Experts, о котором мы писали в статье про Colibri. Из 2.4 триллиона параметров при обработке каждого токена активно работают только 95 миллиардов. Остальные «спят».

Именно это позволяет сделать такую большую модель — и при этом не требовать фантастических вычислительных ресурсов для каждого запроса.

ПараметрЗначение
Всего параметров2.4 триллиона
Активных на токен95 миллиардов (MoE)
Контекстное окно1 000 000 токенов
Макс. вывод131 072 токена
Макс. бюджет reasoning262 144 токена
Модальности (вход)Текст, изображения, видео
Режим reasoninglow / medium / xhigh (дефолт: xhigh)
API-совместимостьOpenAI Chat Completions + Anthropic API

Последний пункт — практически важный. Работает как через OpenAI SDK, так и через Anthropic SDK. Если у вас уже есть пайплайн под Claude Code или Codex — переключить модель на Qwen можно меняя только base_url.


Цены: дешевле в 4 раза — но есть нюанс

На бумаге разрыв огромный:

МодельВход / 1MВыход / 1M
Qwen3.8-Max$2.00$6.00
Kimi K3$3.00$15.00
Claude Opus 5$5.00$25.00
GPT-5.6 Sol$5.00$30.00
Claude Fable 5$10.00$50.00

Разрыв по выходу: в 2.5 раза дешевле Kimi, в 4 раза дешевле Opus 5, в 5 раз дешевле Sol.

Как это выглядит на реальных задачах:

ЗадачаQwen3.8-MaxKimi K3
Обычный чат (1K вход + 500 выход)~$0.005$0.011
Code review (50K вход + 3K выход)~$0.118$0.195
Агентская сессия (200K кэш + 20K вход + 10K выход)~$0.15$0.27

Нюанс, который важно знать до подписки

Qwen3.8-Max по умолчанию работает в режиме xhigh reasoning — максимальная глубина думания. Это хорошо для качества, но плохо для кошелька: модель тратит много токенов на reasoning-процесс.

В одном реальном тесте: Qwen использовал 18 миллионов входных токенов на той же задаче, где Kimi K3 потратил 9.5 миллиона. Разница в 1.9 раза. При нынешних ценах итоговый счёт оказался почти одинаковым.

Если важна экономия — переключитесь на reasoning low или medium для несложных задач.

Ещё один бонус: ночная скидка 80% в off-peak часы — если задачи не срочные, планировать ночные батч-запросы выгодно.


Бенчмарки: где первый, где проседает

Главный козырь — PaperBench

PaperBench — бенчмарк на воспроизведение научных работ. Модели дают описание эксперимента, она должна написать код и воспроизвести результаты. Это не «ответь на вопрос про науку» — это реальная многошаговая исследовательская задача.

МодельPaperBench
Qwen3.8-Max93.0 🥇
GPT-5.6 Sol90.5
Claude Fable 588.8
Claude Opus 4.880.3

10 пунктов над Opus 4.8 и 4 пункта над Fable 5. Для scientific research, автоматизации экспериментов, работы с академическими данными — это реальное преимущество.

Следование инструкциям — IFBench

МодельIFBench
Qwen3.8-Max82.8 🥇
GPT-5.6 Sol72.7
Claude Fable 563.5

Это не академическая цифра. IFBench измеряет, насколько точно модель следует сложным пользовательским инструкциям с несколькими условиями. +10 над Sol, +19 над Fable — модель буквально лучше слушается.

Кодинг — неоднозначно

БенчмаркQwen3.8-MaxGPT-5.6 SolClaude Fable 5
Terminal-Bench 2.186.688.884.6
SWE-bench Pro67.764.680.0

Terminal-Bench — между Sol и Fable, ближе к Sol. Хорошо. SWE-bench Pro (реальные GitHub-задачи) — 67.7, тогда как Fable 5 даёт 80.0. Разрыв в 12 пунктов. Для серьёзного software engineering Fable остаётся лучше.

Мультимодальные — сильно

БенчмаркQwen3.8-Max
MathVision95.2
LogicVista91.9
OSWorld-Verified86.1

Мультимодальные задачи — сильная сторона модели. Но: все эти цифры self-reported, независимых замеров на момент выхода не было.


Arena-позиции — реальный пользовательский рейтинг

Arena (LMArena) — платформа, где люди слепо выбирают между двумя моделями. Это человеческое предпочтение, а не академический бенчмарк.

ArenaМестоБаллы
Vision Arena🥈 #21305 (уступает только Fable 5 High — 1318)
Frontend Code Arena🏅 #41668 (на 1 балл ниже Opus 5 High, на 8 ниже Kimi K3 Max)
Text Arena🏅 #5

Отдельный факт: Arena построила график «баллы vs цена» — Qwen3.8-Max попал на Pareto frontier. Это значит: нет другой модели, которая была бы одновременно дешевле и лучше. Только Claude Opus 5, Kimi K3 и GLM-5.2 на этой же кривой оптимального выбора.


Qwen3.8-Max vs Kimi K3 — прямое сравнение

Это главный вопрос для тех, кто выбирает среди «дешёвых флагманов».

ПараметрQwen3.8-MaxKimi K3
Параметры2.4T (95B активных)2.8T (104B активных)
Цена вход / выход$2 / $6$3 / $15
Контекст1M1.05M
Мультимодальность✅ текст + фото + видео✅ текст + фото + видео
Open weightsОбещают «на след. неделе»✅ Уже (с 27 июля)
Frontend Code Arena#4 (1668)#2 (1676)
Terminal-Bench 2.186.688.3
CharXiv (график-reasoning)93.591.3
Независимые бенчмарки❌ пока нет✅ есть

Реальный тест: StackPerf от TrilogyAI

Команда TrilogyAI прогнала обе модели через одинаковые задачи:

МетрикаKimi K3Qwen3.8-Max
Итоговый балл8380
Цитирований репозитория274354
Tool calls5344
Failed tool calls2 (восстановлено)0
Сильные стороныLifecycle reasoning, скорость, token efficiencySystem boundary design, tool discipline

Kimi чуть лучше в итоговом счёте. Qwen интереснее копает в репозитории и не делает ошибочных вызовов инструментов.

Вердикт: Kimi K3 — проверенный вариант с независимой верификацией и уже доступными весами. Qwen — перспективный конкурент с лучшей ценой на выход и сильными мультимодальными возможностями, но пока без независимых оценок.


Открытые веса — что реально происходит

«На следующей неделе» — обещание Alibaba на момент GA 3 августа. Что конкретно обещают:

  • Веса Qwen3.8-Max на Hugging Face и ModelScope
  • Одновременно — Qwen3.8-27B

Что не объявлено: точная дата, лицензия, model card, требования к железу, форматы квантизации.

Честно про локальный запуск Max

Qwen3.8-Max на своём сервере — это датацентр. При 4-bit квантизации модель займёт ~1.2 терабайта. Даже восьмикарточный H200 с 1,128 GB VRAM не потянет. Нужен multi-node inference.

Qwen3.8-27B — вот где интересно для всех остальных

Это «закопанный заголовок» всего анонса. Пока все смотрят на 2.4T-флагман, 27B-модель — та, что реально запустится на пользовательском железе:

  • ~14-16 GB в 4-bit → RTX 4090 (24GB) или Mac (32GB+)
  • Быстрая поддержка в llama.cpp и Ollama — ожидаемо
  • Вероятно Apache 2.0 (как предыдущий Qwen3.6-27B)

Это потенциально самая доступная открытая модель топ-уровня для домашних экспериментов.


QwenWork и Apple Intelligence — дистрибуция

QwenWork

Запущен 3 августа вместе с моделью — AI-рабочая платформа (веб + десктоп). Аналог ChatGPT Work и Claude Cowork. Публичная бета. Что внутри — пока документировано мало.

Apple Intelligence в Китае

С 15 июля 2026 Qwen3.8-Max работает как движок Apple Intelligence в Китае. Это не партнёрство в обычном смысле — Китай требует от Apple использовать местных AI-провайдеров.

Но результат существенный: миллионы пользователей iPhone и Mac в Китае уже работают с Qwen каждый день — без того, чтобы специально выбирать эту модель. Такого дистрибуционного канала нет ни у Kimi, ни у GLM.

Совместимость с агентами

Благодаря двойной API-совместимости (OpenAI + Anthropic) можно подключить Qwen3.8-Max к:

  • Claude Code (ANTHROPIC_BASE_URL)
  • Codex (OPENAI_BASE_URL)
  • Cursor, Cline, OpenCode, jcode
# Через OpenAI SDK
from openai import OpenAI
client = OpenAI(
    api_key="your_qwen_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

# Через Anthropic SDK
import anthropic
client = anthropic.Anthropic(
    api_key="your_qwen_key",
    base_url="https://dashscope.aliyuncs.com/anthropic-mode/v1"
)
Лиза: «Прикинь — Qwen через Anthropic-совместимый API в Claude Code, и при этом в 4 раза дешевле. Я попробовала на задачах для VibeCoderz: IFBench 82.8 (следование инструкциям) — это реально чувствуется. Агент не отходит от структуры, держит формат. Но на сложных кодинг-задачах Opus 5 всё равно плотнее.»

Карта выбора — кому что брать

Ваша задачаЛучший выборПочему
Научные / исследовательские задачиQwen3.8-MaxPaperBench #1 в мире (93.0)
Следование сложным инструкциямQwen3.8-MaxIFBench #1 (+10 над Sol)
Мультимодальные (фото, видео, документы)Qwen3.8-MaxVision Arena #2
Бюджет критичен, объём большойQwen3.8-MaxВ 4 раза дешевле Opus 5 на выходе
Фронтенд-кодингKimi K3Frontend Code Arena #2
Терминальные агентские задачиKimi K3 или GPT-5.6 SolTerminal-Bench выше
Software engineering (реальные PR, баги)Claude Fable 5SWE-bench Pro 80.0
Максимальная верификацияClaude Opus 5Независимые бенчмарки, зрелость
Локально на своём компеQwen3.8-27B (скоро)14-16GB в 4-bit
Compliance и безопасностьClaude / OpenAIКонтролируемая юрисдикция

Честно про ограничения

Бенчмарки self-reported. На момент выхода 3 августа независимых оценок от Artificial Analysis и других платформ не было. Nikkei Asia прямо написала: Alibaba утверждает «второй только после Fable 5», но это пока не подтверждено. Доверяй, но проверяй на своих задачах.

Token efficiency — ловушка низкой цены. xhigh reasoning по умолчанию означает, что модель тратит много токенов думая. На одной задаче x1.9 больше входных токенов по сравнению с Kimi K3. При $2 за 1M вход это съедает часть ценового преимущества.

Open weights без лицензии — обещание, не продукт. Alibaba не объявила ни лицензию, ни точную дату. Кому-то важно Apache 2.0 (как у прошлых Qwen-моделей), кому-то — bespoke (как у Kimi). Ждать и смотреть.

SWE-bench Pro 67.7. Для серьёзного software engineering, где нужен Fable 5 с его 80.0, разрыв в 12 пунктов — это ощутимо на реальных задачах.

Юрисдикция. Для ряда enterprise-клиентов данные не могут идти через серверы Alibaba Cloud. Это не технический вопрос — это compliance.


FAQ

Qwen3.8-Max работает с Claude Code?
Да. Через ANTHROPIC_BASE_URL или как OpenAI-совместимый провайдер. Меняешь одну переменную — пайплайн остаётся.

Что значит «xhigh reasoning по умолчанию»?
Модель перед каждым ответом глубоко думает — это повышает качество, но тратит дополнительные токены. Если задача простая — выгоднее переключить на low или medium.

Apple Intelligence в России использует Qwen?
Нет. Qwen3.8-Max — модель для Apple Intelligence только в Китае. В России Apple Intelligence пока работает с другими моделями.

Qwen3.8-27B запустится на моём Mac?
Если у вас Mac с 32GB RAM или больше — скорее всего да. В 4-bit квантизации это ~14-16GB. Поддержка в Ollama появится быстро после выхода весов.

Чем Qwen3.8-Max отличается от Qwen3.6?
Qwen3.6 — предыдущее поколение с меньшими параметрами. Qwen3.8 — первая Max-модель с 2.4T параметрами и мультимодальностью (видео + изображения). Принципиально новый уровень.

Стоит ли переходить с Claude Opus 5 прямо сейчас?
Для исследовательских задач и работы с мультимедиа — стоит протестировать. Для кодинга и агентных задач с высокими требованиями — подождать независимых бенчмарков или проверить на своих задачах самостоятельно.


Глоссарий

MoE (Mixture of Experts) — архитектура нейросети, где из общего числа параметров для каждого токена активна только часть. Qwen3.8-Max: 2.4T всего, 95B активных. Позволяет создавать огромные модели без пропорционального роста вычислительных затрат.

Reasoning effort — параметр, определяющий, сколько токенов модель тратит на «обдумывание» перед ответом. xhigh = максимум (дефолт у Qwen3.8-Max), low = минимум.

PaperBench — бенчмарк на воспроизведение научных экспериментов. Модель получает описание работы, должна написать код и воспроизвести результаты. Один из наиболее практичных тестов для исследовательских задач.

IFBench — Instruction Following Benchmark. Тест на точность следования сложным пользовательским инструкциям с несколькими условиями одновременно.

Pareto frontier — кривая оптимальных решений: нет точки, которая была бы лучше по всем параметрам одновременно. Если модель на Pareto frontier по цена/качество — нет более дешёвой модели с тем же качеством.

Token efficiency — насколько эффективно модель использует токены для достижения результата. Низкая efficiency = много токенов тратится на reasoning, высокая = модель кратко и точно.

Knowledge cutoff — дата, после которой у модели нет информации о событиях мира. У Qwen3.8-Max не опубликована.

Apple Intelligence — AI-функции в iPhone и Mac. В Китае работает на базе Qwen3.8-Max (с 15 июля 2026) из-за требований китайского регулятора к локальным провайдерам данных.

Model Studio (Alibaba Cloud) — платформа Alibaba для доступа к моделям Qwen через API. Аналог OpenAI Platform и Anthropic Console.


Официальный сайт Qwen — qwen.ai. API через Alibaba Cloud — modelstudio.aliyun.com. Веса на HuggingFace — huggingface.co/Qwen. Независимый рейтинг — lmarena.ai.

Смотрите каталог AI-моделей на VibeCoderz — там актуальные сравнения всех флагманов.

Вопросы по выбору модели под конкретные задачи и юнит-экономику — к Максиму.


Обновлено: 4 августа 2026. Источники: Alibaba Cloud Blog, Alizila, VentureBeat, MarkTechPost, The Decoder, BenchLM, SCMP, Nikkei Asia, LMArena, TrilogyAI StackPerf.

All Posts

Автор

Максим Наговицын
Максим Наговицын

Маркетинг-стратег, IT-предприниматель, ментор по вайбкодингу

2026/08/04

10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.

Об авторе →

Читать далее

📢 Новость

Claude Code: новый CLI-агент от Anthropic

Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.

2026/02/27
📝 Конспект

Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов

Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.

2026/02/28
📝 Конспект

YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026

Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.

2026/02/28
📝 Конспект

Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода

Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.

2026/02/28
📝 Конспект

Vk Fast Cash Strategy

Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех

2026/02/28