Alibaba Qwen Team выпустила Qwen3.8-Max — свою самую мощную модель. 2.4 триллиона параметров, мультимодальность, первое место в мире по PaperBench (воспроизведение научных работ), Vision Arena #2 — и цена в 4 раза ниже Claude Opus 5.
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
Об авторе →Claude Code: новый CLI-агент от Anthropic
Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.
Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов
Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.
YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026
Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.
Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода
Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.
Vk Fast Cash Strategy
Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех
Alibaba Qwen Team выпустила Qwen3.8-Max — свою самую мощную модель. 2.4 триллиона параметров, мультимодальность, первое место в мире по PaperBench (воспроизведение научных работ), Vision Arena #2 — и цена в 4 раза ниже Claude Opus 5.
Плюс: с 15 июля она уже работает как движок Apple Intelligence в Китае. Миллионы айфонов.
Но есть нюансы, которые важно понять до того, как бежать подключать API.
Qwen3.8-Max (3 августа 2026) — 2.4T параметров MoE, $2/$6 за 1M токенов, PaperBench 93.0 (первое место), Vision Arena #2, Frontend Code Arena #4. Открытые веса — «на следующей неделе». Qwen3.8-27B для домашнего железа — вместе с ними. В статье: архитектура, все бенчмарки, сравнение с Kimi K3 и западными моделями, нюанс с токенами, карта выбора.
Ссылки:
Последние два года китайские AI-лаборатории выпускают модели, которые не уступают американским флагманам, но стоят в разы дешевле. Сначала DeepSeek. Потом Kimi. Теперь Qwen — семейство моделей от Alibaba, которое уже много лет развивается, но именно сейчас добралось до верхней лиги.
Qwen3.8-Max — не просто «ещё одна китайская модель». Это:
И через «следующую неделю» после выхода — обещают открытые веса. Первые в классе размером 2+ триллиона параметров.
Это то самое MoE — Mixture of Experts, о котором мы писали в статье про Colibri. Из 2.4 триллиона параметров при обработке каждого токена активно работают только 95 миллиардов. Остальные «спят».
Именно это позволяет сделать такую большую модель — и при этом не требовать фантастических вычислительных ресурсов для каждого запроса.
| Параметр | Значение |
|---|---|
| Всего параметров | 2.4 триллиона |
| Активных на токен | 95 миллиардов (MoE) |
| Контекстное окно | 1 000 000 токенов |
| Макс. вывод | 131 072 токена |
| Макс. бюджет reasoning | 262 144 токена |
| Модальности (вход) | Текст, изображения, видео |
| Режим reasoning | low / medium / xhigh (дефолт: xhigh) |
| API-совместимость | OpenAI Chat Completions + Anthropic API |
Последний пункт — практически важный. Работает как через OpenAI SDK, так и через Anthropic SDK. Если у вас уже есть пайплайн под Claude Code или Codex — переключить модель на Qwen можно меняя только base_url.
На бумаге разрыв огромный:
| Модель | Вход / 1M | Выход / 1M |
|---|---|---|
| Qwen3.8-Max | $2.00 | $6.00 |
| Kimi K3 | $3.00 | $15.00 |
| Claude Opus 5 | $5.00 | $25.00 |
| GPT-5.6 Sol | $5.00 | $30.00 |
| Claude Fable 5 | $10.00 | $50.00 |
Разрыв по выходу: в 2.5 раза дешевле Kimi, в 4 раза дешевле Opus 5, в 5 раз дешевле Sol.
Как это выглядит на реальных задачах:
| Задача | Qwen3.8-Max | Kimi K3 |
|---|---|---|
| Обычный чат (1K вход + 500 выход) | ~$0.005 | $0.011 |
| Code review (50K вход + 3K выход) | ~$0.118 | $0.195 |
| Агентская сессия (200K кэш + 20K вход + 10K выход) | ~$0.15 | $0.27 |
Qwen3.8-Max по умолчанию работает в режиме xhigh reasoning — максимальная глубина думания. Это хорошо для качества, но плохо для кошелька: модель тратит много токенов на reasoning-процесс.
В одном реальном тесте: Qwen использовал 18 миллионов входных токенов на той же задаче, где Kimi K3 потратил 9.5 миллиона. Разница в 1.9 раза. При нынешних ценах итоговый счёт оказался почти одинаковым.
Если важна экономия — переключитесь на reasoning low или medium для несложных задач.
Ещё один бонус: ночная скидка 80% в off-peak часы — если задачи не срочные, планировать ночные батч-запросы выгодно.
PaperBench — бенчмарк на воспроизведение научных работ. Модели дают описание эксперимента, она должна написать код и воспроизвести результаты. Это не «ответь на вопрос про науку» — это реальная многошаговая исследовательская задача.
| Модель | PaperBench |
|---|---|
| Qwen3.8-Max | 93.0 🥇 |
| GPT-5.6 Sol | 90.5 |
| Claude Fable 5 | 88.8 |
| Claude Opus 4.8 | 80.3 |
10 пунктов над Opus 4.8 и 4 пункта над Fable 5. Для scientific research, автоматизации экспериментов, работы с академическими данными — это реальное преимущество.
| Модель | IFBench |
|---|---|
| Qwen3.8-Max | 82.8 🥇 |
| GPT-5.6 Sol | 72.7 |
| Claude Fable 5 | 63.5 |
Это не академическая цифра. IFBench измеряет, насколько точно модель следует сложным пользовательским инструкциям с несколькими условиями. +10 над Sol, +19 над Fable — модель буквально лучше слушается.
| Бенчмарк | Qwen3.8-Max | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 88.8 | 84.6 |
| SWE-bench Pro | 67.7 | 64.6 | 80.0 |
Terminal-Bench — между Sol и Fable, ближе к Sol. Хорошо. SWE-bench Pro (реальные GitHub-задачи) — 67.7, тогда как Fable 5 даёт 80.0. Разрыв в 12 пунктов. Для серьёзного software engineering Fable остаётся лучше.
| Бенчмарк | Qwen3.8-Max |
|---|---|
| MathVision | 95.2 |
| LogicVista | 91.9 |
| OSWorld-Verified | 86.1 |
Мультимодальные задачи — сильная сторона модели. Но: все эти цифры self-reported, независимых замеров на момент выхода не было.
Arena (LMArena) — платформа, где люди слепо выбирают между двумя моделями. Это человеческое предпочтение, а не академический бенчмарк.
| Arena | Место | Баллы |
|---|---|---|
| Vision Arena | 🥈 #2 | 1305 (уступает только Fable 5 High — 1318) |
| Frontend Code Arena | 🏅 #4 | 1668 (на 1 балл ниже Opus 5 High, на 8 ниже Kimi K3 Max) |
| Text Arena | 🏅 #5 | — |
Отдельный факт: Arena построила график «баллы vs цена» — Qwen3.8-Max попал на Pareto frontier. Это значит: нет другой модели, которая была бы одновременно дешевле и лучше. Только Claude Opus 5, Kimi K3 и GLM-5.2 на этой же кривой оптимального выбора.
Это главный вопрос для тех, кто выбирает среди «дешёвых флагманов».
| Параметр | Qwen3.8-Max | Kimi K3 |
|---|---|---|
| Параметры | 2.4T (95B активных) | 2.8T (104B активных) |
| Цена вход / выход | $2 / $6 | $3 / $15 |
| Контекст | 1M | 1.05M |
| Мультимодальность | ✅ текст + фото + видео | ✅ текст + фото + видео |
| Open weights | Обещают «на след. неделе» | ✅ Уже (с 27 июля) |
| Frontend Code Arena | #4 (1668) | #2 (1676) |
| Terminal-Bench 2.1 | 86.6 | 88.3 |
| CharXiv (график-reasoning) | 93.5 | 91.3 |
| Независимые бенчмарки | ❌ пока нет | ✅ есть |
Команда TrilogyAI прогнала обе модели через одинаковые задачи:
| Метрика | Kimi K3 | Qwen3.8-Max |
|---|---|---|
| Итоговый балл | 83 | 80 |
| Цитирований репозитория | 274 | 354 |
| Tool calls | 53 | 44 |
| Failed tool calls | 2 (восстановлено) | 0 |
| Сильные стороны | Lifecycle reasoning, скорость, token efficiency | System boundary design, tool discipline |
Kimi чуть лучше в итоговом счёте. Qwen интереснее копает в репозитории и не делает ошибочных вызовов инструментов.
Вердикт: Kimi K3 — проверенный вариант с независимой верификацией и уже доступными весами. Qwen — перспективный конкурент с лучшей ценой на выход и сильными мультимодальными возможностями, но пока без независимых оценок.
«На следующей неделе» — обещание Alibaba на момент GA 3 августа. Что конкретно обещают:
Что не объявлено: точная дата, лицензия, model card, требования к железу, форматы квантизации.
Qwen3.8-Max на своём сервере — это датацентр. При 4-bit квантизации модель займёт ~1.2 терабайта. Даже восьмикарточный H200 с 1,128 GB VRAM не потянет. Нужен multi-node inference.
Это «закопанный заголовок» всего анонса. Пока все смотрят на 2.4T-флагман, 27B-модель — та, что реально запустится на пользовательском железе:
Это потенциально самая доступная открытая модель топ-уровня для домашних экспериментов.
Запущен 3 августа вместе с моделью — AI-рабочая платформа (веб + десктоп). Аналог ChatGPT Work и Claude Cowork. Публичная бета. Что внутри — пока документировано мало.
С 15 июля 2026 Qwen3.8-Max работает как движок Apple Intelligence в Китае. Это не партнёрство в обычном смысле — Китай требует от Apple использовать местных AI-провайдеров.
Но результат существенный: миллионы пользователей iPhone и Mac в Китае уже работают с Qwen каждый день — без того, чтобы специально выбирать эту модель. Такого дистрибуционного канала нет ни у Kimi, ни у GLM.
Благодаря двойной API-совместимости (OpenAI + Anthropic) можно подключить Qwen3.8-Max к:
ANTHROPIC_BASE_URL)OPENAI_BASE_URL)# Через OpenAI SDK
from openai import OpenAI
client = OpenAI(
api_key="your_qwen_key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
# Через Anthropic SDK
import anthropic
client = anthropic.Anthropic(
api_key="your_qwen_key",
base_url="https://dashscope.aliyuncs.com/anthropic-mode/v1"
)Лиза: «Прикинь — Qwen через Anthropic-совместимый API в Claude Code, и при этом в 4 раза дешевле. Я попробовала на задачах для VibeCoderz: IFBench 82.8 (следование инструкциям) — это реально чувствуется. Агент не отходит от структуры, держит формат. Но на сложных кодинг-задачах Opus 5 всё равно плотнее.»
| Ваша задача | Лучший выбор | Почему |
|---|---|---|
| Научные / исследовательские задачи | Qwen3.8-Max | PaperBench #1 в мире (93.0) |
| Следование сложным инструкциям | Qwen3.8-Max | IFBench #1 (+10 над Sol) |
| Мультимодальные (фото, видео, документы) | Qwen3.8-Max | Vision Arena #2 |
| Бюджет критичен, объём большой | Qwen3.8-Max | В 4 раза дешевле Opus 5 на выходе |
| Фронтенд-кодинг | Kimi K3 | Frontend Code Arena #2 |
| Терминальные агентские задачи | Kimi K3 или GPT-5.6 Sol | Terminal-Bench выше |
| Software engineering (реальные PR, баги) | Claude Fable 5 | SWE-bench Pro 80.0 |
| Максимальная верификация | Claude Opus 5 | Независимые бенчмарки, зрелость |
| Локально на своём компе | Qwen3.8-27B (скоро) | 14-16GB в 4-bit |
| Compliance и безопасность | Claude / OpenAI | Контролируемая юрисдикция |
Бенчмарки self-reported. На момент выхода 3 августа независимых оценок от Artificial Analysis и других платформ не было. Nikkei Asia прямо написала: Alibaba утверждает «второй только после Fable 5», но это пока не подтверждено. Доверяй, но проверяй на своих задачах.
Token efficiency — ловушка низкой цены. xhigh reasoning по умолчанию означает, что модель тратит много токенов думая. На одной задаче x1.9 больше входных токенов по сравнению с Kimi K3. При $2 за 1M вход это съедает часть ценового преимущества.
Open weights без лицензии — обещание, не продукт. Alibaba не объявила ни лицензию, ни точную дату. Кому-то важно Apache 2.0 (как у прошлых Qwen-моделей), кому-то — bespoke (как у Kimi). Ждать и смотреть.
SWE-bench Pro 67.7. Для серьёзного software engineering, где нужен Fable 5 с его 80.0, разрыв в 12 пунктов — это ощутимо на реальных задачах.
Юрисдикция. Для ряда enterprise-клиентов данные не могут идти через серверы Alibaba Cloud. Это не технический вопрос — это compliance.
Qwen3.8-Max работает с Claude Code?
Да. Через ANTHROPIC_BASE_URL или как OpenAI-совместимый провайдер. Меняешь одну переменную — пайплайн остаётся.
Что значит «xhigh reasoning по умолчанию»?
Модель перед каждым ответом глубоко думает — это повышает качество, но тратит дополнительные токены. Если задача простая — выгоднее переключить на low или medium.
Apple Intelligence в России использует Qwen?
Нет. Qwen3.8-Max — модель для Apple Intelligence только в Китае. В России Apple Intelligence пока работает с другими моделями.
Qwen3.8-27B запустится на моём Mac?
Если у вас Mac с 32GB RAM или больше — скорее всего да. В 4-bit квантизации это ~14-16GB. Поддержка в Ollama появится быстро после выхода весов.
Чем Qwen3.8-Max отличается от Qwen3.6?
Qwen3.6 — предыдущее поколение с меньшими параметрами. Qwen3.8 — первая Max-модель с 2.4T параметрами и мультимодальностью (видео + изображения). Принципиально новый уровень.
Стоит ли переходить с Claude Opus 5 прямо сейчас?
Для исследовательских задач и работы с мультимедиа — стоит протестировать. Для кодинга и агентных задач с высокими требованиями — подождать независимых бенчмарков или проверить на своих задачах самостоятельно.
MoE (Mixture of Experts) — архитектура нейросети, где из общего числа параметров для каждого токена активна только часть. Qwen3.8-Max: 2.4T всего, 95B активных. Позволяет создавать огромные модели без пропорционального роста вычислительных затрат.
Reasoning effort — параметр, определяющий, сколько токенов модель тратит на «обдумывание» перед ответом. xhigh = максимум (дефолт у Qwen3.8-Max), low = минимум.
PaperBench — бенчмарк на воспроизведение научных экспериментов. Модель получает описание работы, должна написать код и воспроизвести результаты. Один из наиболее практичных тестов для исследовательских задач.
IFBench — Instruction Following Benchmark. Тест на точность следования сложным пользовательским инструкциям с несколькими условиями одновременно.
Pareto frontier — кривая оптимальных решений: нет точки, которая была бы лучше по всем параметрам одновременно. Если модель на Pareto frontier по цена/качество — нет более дешёвой модели с тем же качеством.
Token efficiency — насколько эффективно модель использует токены для достижения результата. Низкая efficiency = много токенов тратится на reasoning, высокая = модель кратко и точно.
Knowledge cutoff — дата, после которой у модели нет информации о событиях мира. У Qwen3.8-Max не опубликована.
Apple Intelligence — AI-функции в iPhone и Mac. В Китае работает на базе Qwen3.8-Max (с 15 июля 2026) из-за требований китайского регулятора к локальным провайдерам данных.
Model Studio (Alibaba Cloud) — платформа Alibaba для доступа к моделям Qwen через API. Аналог OpenAI Platform и Anthropic Console.
Официальный сайт Qwen — qwen.ai. API через Alibaba Cloud — modelstudio.aliyun.com. Веса на HuggingFace — huggingface.co/Qwen. Независимый рейтинг — lmarena.ai.
Смотрите каталог AI-моделей на VibeCoderz — там актуальные сравнения всех флагманов.
Вопросы по выбору модели под конкретные задачи и юнит-экономику — к Максиму.
Обновлено: 4 августа 2026. Источники: Alibaba Cloud Blog, Alizila, VentureBeat, MarkTechPost, The Decoder, BenchLM, SCMP, Nikkei Asia, LMArena, TrilogyAI StackPerf.