Три лаборатории выпустили свои главные модели почти подряд: GPT-5.6 Sol от OpenAI 9 июля, Claude Opus 5 от Anthropic 24 июля, Qwen3.8-Max от Alibaba 3 августа. Все три метят в одну нишу: интеллект уровня топовых flagship-моделей за цену в разы ниже прошлогодней. В статье разберем цены, реальные бенчмарки и то, какую модель ставить в свой стек для вайбкодинга.
Обновлено: август 2026. Три frontier-модели вышли за 25 дней. Opus 5 стоит $5/$25 за million токенов, GPT-5.6 Sol $5/$30, Qwen3.8-Max $2/$6. Все три приближаются к уровню Claude Fable 5, но стоят от четверти до половины его цены. В статье таблицы по бенчмаркам, ценам и рекомендация под конкретную задачу.
Какие три модели вышли за последний месяц
GPT-5.6 Sol стал доступен 9 июля, Claude Opus 5 24 июля, Qwen3.8-Max 3 августа. Между первым и последним релизом прошло меньше месяца.
Три компании выкатили обновления почти синхронно, и это не совпадение. GPT-5.6 Sol, Claude Opus 5 и Qwen3.8-Max объединяет одна идея: дать интеллект уровня прошлогодних топ-моделей за половину или четверть цены. Причем именно Qwen3.8-Max сбил цену сильнее всех, до $2 за million входных токенов.
Все три релиза случились после того, как в июне вышел Claude Fable 5, первая модель нового класса Mythos у Anthropic. Fable 5 задрал планку интеллекта и цены разом, $10/$50 за million токенов. GPT-5.6 Sol, Opus 5 и Qwen3.8-Max, каждый по-своему, отвечают на вопрос: можно ли получить похожий результат дешевле.

| Модель | Разработчик | Дата GA | Цена вход/выход за 1M | Контекст |
|---|---|---|---|---|
| GPT-5.6 Sol | OpenAI | 9 июля 2026 | $5 / $30 | 1.05M / 128K |
| Claude Opus 5 | Anthropic | 24 июля 2026 | $5 / $25 | 1M / 128K |
| Qwen3.8-Max | Alibaba | 3 августа 2026 | $2 / $6 | 1M / 131K |
Чем Claude Opus 5 отличается от Opus 4.8 и Fable 5
Opus 5 стоит столько же, сколько Opus 4.8, но на Frontier-Bench удваивает его результат и почти догоняет Fable 5. Главная фишка: ручной регулятор глубины размышления.
Anthropic не назвала Opus 5 новым флагманом. В своем анонсе компания прямо пишет: модель "для ежедневного использования", которая приближается к интеллекту Fable 5 вдвое дешевле. Цена та же, что у Opus 4.8: $5 за million входных токенов и $25 за million выходных, это ровно половина от Fable 5.
Разница на бенчмарках выглядит резко. На Frontier-Bench, который проверяет агентный кодинг в реальном терминале, Opus 5 набрал 43,3%. У Opus 4.8 результат был около 19%. На ARC-AGI-3, тесте новых задач без готовых паттернов, Opus 5 показал 30,2%, это втрое выше ближайшего конкурента и подтверждено независимо Arc Prize Foundation.
Ключевая новая функция, effort dial: можно вручную выбрать глубину размышления модели от low до max под каждый конкретный запрос. Низкий уровень быстрый и дешевый для рутины, высокий и extra high включаются для сложной отладки или длинных отчетов. Anthropic советует начинать с high для кодинга и понижать, если качество не падает.
Есть и раздражающий момент. Часть пользователей отмечает, что Opus 5 обрывает задачу раньше времени и спорит там, где предыдущая версия просто выполняла инструкцию. Особенно это заметно на старых промптах, написанных под Opus 4.8: модель воспринимает фразы вроде "проверь свою работу в конце" буквально и начинает перепроверять по кругу, потому что верификация уже встроена по умолчанию.
GPT-5.6 Sol что изменилось у OpenAI
Sol это флагман новой линейки из трех моделей: Sol, Terra и Luna. Он лидирует на Terminal-Bench 2.1 и умеет сам писать мини-программы для управления инструментами.
OpenAI отказалась от схемы "одна модель с ползунком" и выпустила сразу три модели одного поколения. Sol занимает верх линейки и стоит $5 за million входных токенов и $30 за выходные, Terra дешевле в два раза, Luna рассчитана на массовые простые задачи по $1/$6.
На Terminal-Bench 2.1, тесте командной строки, базовый Sol набрал 88,8%. В режиме Ultra, который запускает четыре агента параллельно на одну задачу, результат вырастает до 91,9%, это выше, чем у Claude Mythos 5. Отдельно OpenAI выделяет programmatic tool calling: вместо того чтобы гонять каждый результат инструмента обратно через модель, Sol сам пишет короткий скрипт, который управляет цепочкой вызовов и возвращает только нужное.
Есть нюанс с ценой на длинный контекст. Если запрос превышает 272 000 входных токенов, весь запрос целиком тарифицируется по повышенной ставке $10/$45. Для задач с большими кодовыми базами это стоит учитывать заранее, иначе счет за месяц удивит.
Qwen3.8-Max почему китайская модель обвалила цену
Qwen3.8-Max стоит $2 за million входных токенов, вдвое дешевле Opus 5 и Sol. При этом по версии Alibaba модель на втором месте в мире по зрению, сразу после Fable 5.
Alibaba выкатила самую крупную модель в истории линейки Qwen, 2,4 триллиона параметров с архитектурой MoE и примерно 95 миллиардов активных на токен. Цена, $2 за million входных токенов и $6 за выходные, ставит модель в прямую ценовую конкуренцию с GPT-5.6 на площадке OpenRouter. Кэшированный вход стоит вообще $0,25, это одна восьмая обычной ставки для повторяющегося кода или документа.
На PaperBench, тесте написания исследовательской статьи с нуля, у Qwen3.8-Max лучший результат среди всех трех моделей, 93,0. На Terminal-Bench 2.1 модель набрала 86,6%, опередив Opus 4.8 и Fable 5 (у обоих 84,6%), но осталась позади Sol. А вот на SWE-bench Pro, классике чистого софтверного инжиниринга, разрыв с Fable 5 заметный: 67,7% против 80%. Зато на визуальных задачах Qwen3.8-Max держится на втором месте среди всех моделей мира, уступая только Fable 5, и это подтверждается и на публичной Arena, и на закрытых бенчмарках Alibaba одновременно.
Открытые веса модели и младшей версии на 27 миллиардов параметров Alibaba обещает выложить на неделе после 10 августа. Раньше ни одна Max-модель линейки Qwen в открытый доступ не попадала. Отдельно стоит держать в голове: облачный API работает под юрисдикцией китайского законодательства, так что чувствительные корпоративные данные через него лучше не гонять до появления self-host весов.
Сколько реально стоит одна и та же задача на разных моделях
Разница в цене превращается в разницу поведения: задача за $8 заставляет думать дважды, а задача за 35 центов запускают просто так, десятки раз подряд.
Возьмем типовую агентную задачу: 200 000 входных токенов, например код репозитория, и 50 000 выходных. На Opus 5 такой запуск обойдется примерно в $8,25. На GPT-5.6 Sol (полная версия) около $4,10. На Qwen3.8-Max всего 70 центов, а если большая часть входа закэширована, цена падает до 35 центов.
Это не абстрактная экономия. Это разница между "запустил агента один раз и проверил результат" и "прогнал вариант пятьдесят раз, пока не получил идеальный". Для итеративной разработки, где агент правит один и тот же код десятки итераций подряд, именно кэшированная цена входа решает бюджет месяца.

Максим: «Мы веб-версию GoBanana собрали за 3 часа после выхода новой модели, 6-8 часов суммарно на продукт, который принес 12 миллионов рублей. Когда запуск задачи стоит копейки, ты просто пробуешь в десять раз больше вариантов, и рано или поздно один выстреливает».
| Задача (200K вход / 50K выход) | Claude Opus 5 | GPT-5.6 Sol | Qwen3.8-Max |
|---|---|---|---|
| Обычная цена | ~$8,25 | ~$4,10 | ~$0,70 |
| С кэшем на повторный вход | дешевле, но кэш стоит $0,50/M | дешевле, кэш $0,50/M | ~$0,35, кэш $0,25/M |
Кто лидирует по бенчмаркам на самом деле
Прямого победителя нет: Opus 5 сильнее в агентном кодинге и новых задачах, Sol держит терминал и инструменты, Qwen3.8-Max выигрывает по зрению и цене.
Сравнивать чужие бенчмарки напрямую опасно: когда OpenAI публиковала свои графики для Sol, модели Opus 5 еще не существовало, ее сравнивали с Fable 5. А когда Anthropic публиковала цифры Opus 5, сравнение шло уже с собственной линейкой моделей. Формально это два разных забега на двух разных днях.
На независимой Arena, где реальные люди голосуют за лучший ответ, картина честнее. На текстовой доске лидируют модели Claude, но разрыв между первым и пятым местом всего 13 пунктов, статистически это ничья. На доске фронтенд-кода Qwen3.8-Max занял четвертое место, отставая от Opus 5 на high-эффорте всего на одно очко. На доске зрения Qwen3.8-Max второй в мире, позади только Fable 5, и обходит все версии Opus, Gemini и GPT.

| Бенчмарк | Claude Opus 5 | GPT-5.6 Sol | Qwen3.8-Max |
|---|---|---|---|
| Frontier-Bench / Terminal-Bench 2.1 | 43,3% | 88,8% (Ultra 91,9%) | 86,6% |
| ARC-AGI-3 (новые задачи) | 30,2% | 7,8% | не публиковался |
| SWE-bench Pro | сильно выше Qwen | конкурентно | 67,7% |
| Vision / OSWorld-Verified | средне | 83,2 | 86,1 (#2 в мире) |
Важная оговорка: Terminal-Bench и Frontier-Bench это разные тесты с разной методологией, напрямую цифры 43,3% и 88,8% сравнивать нельзя, они измеряют не одно и то же. Anthropic честно раскрывает: часть агентных задач Opus 5 в случае отказа классификатора безопасности откатывается на Opus 4.8, так что итоговый скор не всегда результат одной модели.
Какую модель выбрать для агентного кодинга
Для длинных автономных задач Sol и Opus 5 держатся вровень, для массового запуска дешевых итераций выигрывает Qwen3.8-Max.
Если агент должен сам писать код, тестировать и чинить баги на протяжении многих шагов, Opus 5 с высоким эффортом и Sol в режиме Ultra показывают близкий результат, разница часто решается харнессом, а не моделью. Практики, которые гоняли оба варианта внутри одной среды на реальных проектах, вроде игр или лендингов, описывают ничью: Sol точнее в действии и графике, Opus точнее в атмосфере и деталях интерфейса.
Для задач, где важна не абсолютная планка, а количество прогонов в день, Qwen3.8-Max меняет саму экономику работы. Прикинь: задача, которая на Opus 5 стоит восемь долларов, на Qwen обходится в семьдесят центов. Это разница между "запустил один раз и надеешься" и "запустил полсотни вариантов и выбрал лучший".
Какую модель выбрать вайбкодеру с ограниченным бюджетом
Для бюджетных агентных циклов лучший выбор Qwen3.8-Max, для критичных production-задач стоит держать Opus 5 или GPT-5.6 Sol Terra как второй слот.
Один слот на все случаи жизни работает плохо. Практики, тестировавшие все три модели неделями, обычно держат две: одну для повседневных задач и вторую для по-настоящему сложных автономных прогонов. Модели, которые пробовали заменить собой Fable 5 целиком, Opus 5 в том числе, вызывают жалобы: не хватает "потолка" на самых тяжелых задачах, хотя цена привлекательна.
Практическая раскладка: Qwen3.8-Max для массовых бюджетных агентных циклов и визуальных задач, GPT-5.6 Sol Terra или базовый Sol для ежедневного кодинга с инструментами, Opus 5 или Fable 5 для задач, где цена вторична, а нужен максимальный потолок интеллекта. Такая связка обычно выходит дешевле, чем прогонять все через одну дорогую модель по умолчанию.
Для повседневной работы с любой из трех моделей удобно использовать редактор вроде <a href="https://vibecoderz.ru/item/cursor">Cursor</a> или <a href="https://vibecoderz.ru/item/claude-code">Claude Code</a>, они поддерживают переключение моделей без смены рабочего окружения. Полный каталог AI IDE и инструментов для вайбкодинга смотри на <a href="https://vibecoderz.ru/ide">vibecoderz.ru/ide</a>.
Стоит ли доплачивать за Fable 5, если есть эти три модели
Fable 5 все еще лидирует на узком наборе тестов чистого софтверного инжиниринга, но для большинства ежедневных задач Opus 5, Sol и Qwen3.8-Max закрывают разрыв за 20-50% цены.
Формально Fable 5 остается самой умной моделью Anthropic на рынке, но ее преимущество сузилось до пары конкретных бенчмарков вроде SWE-bench Pro, где отрыв меньше процентного пункта на некоторых замерах. При этом Fable 5 стоит вдвое дороже Opus 5 и вчетверо дороже Qwen3.8-Max. Для дня, когда нужен потолок интеллекта на многодневной автономной задаче, Fable 5 еще имеет смысл. Для остального рынок за последний месяц догнал ее вплотную.
Глоссарий
- SWE-bench это набор реальных задач из открытых репозиториев на GitHub, проверяет способность модели чинить баги и писать код.
- Frontier-Bench / Terminal-Bench это тесты агентного кодинга внутри реального терминала, модель сама пишет и запускает команды.
- ARC-AGI-3 это бенчмарк новых задач без готовых паттернов в обучающих данных, проверяет "сырое" мышление, а не память.
- MoE (Mixture-of-Experts) это архитектура, где у модели много блоков-"экспертов", но на каждый токен активируется только часть из них, это снижает стоимость вычислений.
- Effort dial / effort toggle это ручная настройка глубины размышления модели под конкретный запрос, от low до max.
- Open weights это ситуация, когда веса модели лежат в открытом доступе: их можно скачать и запустить на своем железе без обращения к API разработчика.
- Arena (LMArena) это независимая площадка, где живые люди сравнивают ответы двух моделей вслепую и голосуют за лучший.
Часто задаваемые вопросы
Какая из трех моделей самая дешевая? Qwen3.8-Max, $2 за million входных токенов и $6 за выходные. Это вдвое дешевле Opus 5 и Sol по входу и вчетверо дешевле Fable 5.
Стоит ли переходить с Opus 4.8 на Opus 5 прямо сейчас? Цена не изменилась, а результат на агентном кодинге вырос примерно вдвое. Единственный минус: часть старых промптов с инструкциями "проверь себя" придется переписать под новую модель.
Что лучше для агентного кодинга: Opus 5 или GPT-5.6 Sol? На практике результат близкий, выбор чаще решает харнесс и привычный стек инструментов, а не сама модель. Sol точнее в действии, Opus точнее в деталях интерфейса.
Можно ли использовать Qwen3.8-Max в России? Модель доступна через API на QwenCloud и агрегаторы вроде OpenRouter. Открытые веса выходят в середине августа 2026, после чего модель можно будет развернуть на своем железе.
Заменяет ли Opus 5 модель Fable 5? Нет полностью. Opus 5 приближается по интеллекту, но на узких тестах чистого софтверного инжиниринга Fable 5 все еще впереди. Для многодневных автономных проектов Fable 5 остается более безопасным выбором.
Когда выйдут открытые веса Qwen3.8-Max? Alibaba обещает выложить веса на Hugging Face и ModelScope на неделе после 10 августа 2026 года, вместе с младшей версией на 27 миллиардов параметров.
Какая модель лучше для дизайна и визуальных задач? Qwen3.8-Max, по независимым замерам занимает второе место в мире по зрению, уступая только Fable 5 и опережая все версии Opus, Gemini и GPT.
Кому что выбрать: итоговая карта

| Задача | Лучший выбор | Почему |
|---|---|---|
| Массовый агентный цикл, бюджет важен | Qwen3.8-Max | цена в 10 раз ниже за тот же job |
| Ежедневный кодинг с инструментами | GPT-5.6 Sol / Terra | programmatic tool calling, стабильный харнесс |
| Сложная многошаговая отладка | Claude Opus 5 (high/max effort) | лидер на Frontier-Bench и ARC-AGI-3 |
| Визуальные и дизайн-задачи | Qwen3.8-Max | #2 в мире по зрению |
| Многодневный автономный проект без ограничения бюджета | Claude Fable 5 | все еще потолок по чистому SWE-bench Pro |
Если не уверен, с какой модели начать связку под свой проект, разберем стек на консультации, <a href="https://t.me/maxnagovitsyn">записывайся к Максиму в Telegram</a>. Там же смотрим, какой AI-агент под твою задачу уже есть в <a href="https://vibecoderz.ru/agents">каталоге агентов VibeCoderz</a>.
Обновлено: август 2026.