14 июля 2026 Сбер выложил в открытый доступ сразу два речевых AI-продукта с MIT-лицензией — и это не «ещё один Whisper по-русски». GigaAM Multilingual обходит Whisper Large v3 на всех языках СНГ при меньшем размере модели. GigaChat Audio держит в пам…
400 000+ органических переходов за 3 месяца. Со-основатель GoBanana (231K пользователей, 12+ млн ₽ без рекламы) и NeuroScribe (65K пользователей). SEO/GEO-стратегии для AI-поисковиков, 1 700+ единиц контента, 17+ реализованных стратегий.
Об авторе →Claude Code: новый CLI-агент от Anthropic
Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.
Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов
Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.
YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026
Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.
Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода
Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.
Vk Fast Cash Strategy
Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех
14 июля 2026 Сбер выложил в открытый доступ сразу два речевых AI-продукта с MIT-лицензией — и это не «ещё один Whisper по-русски». GigaAM Multilingual обходит Whisper Large v3 на всех языках СНГ при меньшем размере модели. GigaChat Audio держит в памяти до двух часов аудио и умеет находить конкретные моменты в длинных записях — задача, с которой западные модели просто не справляются.

Обе работы приняты на Interspeech 2026 — главную международную конференцию по распознаванию речи.
Сбер открыл GigaAM Multilingual (MIT, WER 6.4% на русском vs 9.4% у Whisper, поддержка казахского/киргизского/узбекского) и GigaChat Audio (temporal grounding, 2 часа контекста, IoU 48.3 на длинных записях). Оба проекта на GitHub. В статье: что умеют, цифры, где скачать, для каких задач подходит.
Ссылки:
Whisper от OpenAI — сейчас стандарт для распознавания речи в большинстве приложений. Он хорошо работает на английском, сносно на русском. Но если тебе нужен казахский, киргизский или узбекский — Whisper справляется заметно хуже. А если запись длиннее 30 минут — начинает «плыть» и терять нить.
Для России и СНГ это конкретная проблема. Звонки в колл-центре на казахском. Совещание на два часа, из которого нужно вытащить конкретное решение. Голосовые сообщения на узбекском в корпоративном мессенджере.
Сбер занимается речевым AI давно — с 2020 года, когда вышел первый GigaAM. Сейчас они открывают четвёртое поколение этой работы: модель, обученную на 2 миллионах часов речи на 70+ языках, и языковую модель, которая работает напрямую со звуком и помнит двухчасовой разговор целиком.
Представь, что ты диктуешь текст в телефон. Телефон должен понять твои слова и превратить их в текст. Это называется распознавание речи, или ASR (automatic speech recognition).

Качество измеряется показателем WER — Word Error Rate. Это процент слов, которые модель распознала неправильно. Чем меньше — тем лучше. WER 6% означает, что из 100 слов модель ошиблась примерно в 6.
GigaAM Multilingual на русском языке: WER 6.4%. Whisper Large v3 — 9.4%. Это значит, что GigaAM ошибается примерно в полтора раза реже. На длинных текстах разница ощущается очень явно.
На казахском, киргизском и узбекском разрыв ещё больше — потому что Whisper учили преимущественно на английском, и языки СНГ для него «боковые». GigaAM учили специально с балансировкой: ни один язык не доминирует над другими.
Метрика — WER (чем меньше, тем лучше):
| Язык | GigaAM 240M | GigaAM 600M | Whisper Large v3 | Omnilingual 1B |
|---|---|---|---|---|
| Английский | 19.1 | 14.4 | 16.7 | 24.5 |
| Русский | 6.4 | 4.6 | 9.4 | 11.8 |
| Казахский | 13.7 | 12.3 | 17.1 | 19.0 |
| Киргизский | 10.2 | 9.4 | 13.4 | 13.6 |
| Узбекский | 11.7 | 10.5 | 13.8 | 14.2 |
| Среднее | 12.2 | 10.2 | 14.1 | 16.6 |
240M-версия GigaAM обходит Whisper Large v3 (1.55 млрд параметров) при размере в 7 раз меньше.

Это так называемые low-resource языки — данных для обучения мало. Сбер взял один публичный датасет (Common Voice) и дообучил модель. Результат:
| Язык | GigaAM | Whisper Large v3 |
|---|---|---|
| Башкирский | 3.6% | 11.1% |
| Грузинский | 3.8% | 13.4% |
GigaAM ошибается в 3 раза реже при одинаковых входных данных для обучения. Это значит, что модель хорошо «переносит» знания между языками — важное свойство для работы с редкими языками, на которые нет большого датасета.
Архитектура — Conformer-энкодер (220-240M параметров), предобученный на 2 млн часов речи методом HuBERT-CTC.
Ключевая инновация — cluster-level data balancing. Обычно когда учишь модель на многих языках, доминируют те, которых больше в данных — английский, испанский, русский. Остальные «тонут». Сбер решил это через кластеризацию языков по схожести: языки, близкие друг к другу (например, казахский и киргизский), группируются вместе, и обучение балансируется на уровне кластеров, а не отдельных языков. Именно поэтому модель хорошо работает даже на языках, которых в данных было мало.
Эволюция модели: v1 (2020) — 50K часов данных, v2 — HuBERT-CTC, v3 — 700K часов, +30% качества на новых доменах. Multilingual — 2M часов, 70+ языков.
Это другой продукт с другой задачей.
GigaAM Multilingual — это «уши»: переводит звук в текст. GigaChat Audio — это «уши + мозг»: слышит звук и понимает его содержание, не превращая в текст как промежуточный шаг.

Обычный пайплайн при работе с аудио: запись → расшифровка в текст → текст в LLM → ответ. На каждом шаге теряется что-то важное. Интонация исчезает при расшифровке. Пауза, которая говорит «человек нервничает», превратилась в три точки. Смех в конце фразы стал просто пробелом.
GigaChat Audio работает напрямую со звуком — без промежуточной расшифровки. Это значит, что она слышит не только слова, но и то, как они сказаны.

Temporal grounding — это когда модель находит конкретный момент в аудиозаписи по текстовому описанию. Звучит абстрактно, поэтому давай конкретный пример.
Ты записал двухчасовое совещание. Тебе нужно найти, где именно обсуждали сроки сдачи проекта. Вместо того чтобы перематывать запись вручную — говоришь модели: «найди момент, когда говорили о дедлайне». Модель выдаёт таймстемп: «1:23:47 — 1:31:05».

Это называется IoU (Intersection over Union) — метрика точности, насколько найденный интервал совпадает с реальным. 100 = идеально, 0 = промахнулся полностью.
| Модель | IoU на длинных записях (20-60 мин) |
|---|---|
| GigaChat Audio | 48.3 |
| Voxtral | ~0 |
| Phi-4 | ~0 |
| Qwen3-Omni | ~0 |
Конкуренты показывают около нуля. Не потому что они плохие — просто не умеют работать с длинными записями. Большинство моделей «теряются» после 30 минут аудио.
GigaChat Audio держит контекст до 2 часов благодаря архитектуре на базе GigaChat3.1-10B-A1.8B (MoE — mixture of experts) с интегрированным аудио-энкодером из GigaAM Multilingual.
Для обучения temporal grounding Сбер опубликовал датасет TimeGround-1M — тоже в открытом доступе.
Это тест на понимание и ответы на вопросы по-русски:
| Модель | RuBQ-Audio |
|---|---|
| GigaChat Audio | 60.0 |
| Qwen3-Omni | 43.7 |
37% преимущества над ближайшим конкурентом.
В продакшне:
В опенсорсе:
GigaAM Multilingual — когда нужно превратить звук в текст:
GigaChat Audio — когда нужно понять содержание аудио:
Максим: «У меня был случай — нужно было разобрать запись полуторачасовых переговоров, найти конкретно момент, где обсуждали условия. Обычно это час работы вручную. Попробовал GigaChat Audio — нашёл нужный фрагмент за минуту. Для B2B-продаж и переговоров это реально меняет рабочий процесс.»
Whisper и другие западные модели создавались в первую очередь для английского языка. Русский там есть, но не как приоритет. Казахский, киргизский, узбекский — ещё более боковые.
При этом в России и СНГ огромное количество речевых задач: колл-центры, юридическая транскрипция, образование на нескольких языках, государственные сервисы. До сих пор приходилось выбирать: либо использовать западные модели с посредственным качеством на родных языках, либо платить за дорогие закрытые решения.
GigaAM Multilingual — это первая открытая модель, которая обучена специально с учётом языков СНГ, превосходит Whisper на этих языках и при этом MIT-лицензия. Берёшь, встраиваешь, адаптируешь.
Отдельно важно: обе работы приняты на Interspeech 2026 — это не маркетинг Сбера, а научная верификация. Независимые рецензенты из мирового сообщества speech AI оценили и приняли.
GigaAM Multilingual:
Английский — не главный приоритет, и это видно: 19.1% WER (240M-версия) против 16.7% у Whisper. Если нужен английский — берите Whisper. Если приоритет СНГ-языки — берите GigaAM.
Модель большая (240M и 600M параметров) — для запуска на мобильном устройстве нужна квантизация или дистилляция.
GigaChat Audio:
IoU 48.3 — хороший результат для задачи, которую конкуренты вообще не решают. Но это не 90%+. На записях с шумом, перебивками или быстрой сменой темы точность будет ниже.
2 часа контекста — у GigaChat Audio. GigaChat-Max-Audio в продакшне держит до 3 часов. Для ещё более длинных записей — чанковать.
Аудио-native модели в целом медленнее текстовых. Ждать результата для длинной записи дольше, чем для расшифровки + текстового запроса.
Попробовать без установки:
Или через Telegram:
Скачать модель для своего проекта:
# GitHub
git clone https://github.com/salute-developers/GigaAM
# Или через HuggingFace
pip install gigaamMIT-лицензия — подходит для коммерческих проектов.
GigaAM Multilingual — это бесплатно?
Да. MIT-лицензия, открытые веса, можно использовать в коммерческих проектах без ограничений.
Чем GigaAM лучше Whisper на русском?
WER 6.4% против 9.4% у Whisper Large v3 — ошибается примерно в полтора раза реже. На длинных текстах это очень заметно.
Поддерживает ли GigaAM азербайджанский и другие языки СНГ?
Предобучен на 70+ языках, но явные бенчмарки опубликованы по русскому, казахскому, киргизскому, узбекскому, башкирскому и грузинскому. Другие языки — в зависимости от их наличия в предобучающем корпусе.
GigaChat Audio работает в реальном времени?
В текущих публичных демо — асинхронный режим (загружаешь файл, получаешь ответ). Real-time streaming — отдельная задача, публично не анонсирована.
Что такое Interspeech и почему важно, что статьи приняты туда?
Interspeech — главная международная конференция по распознаванию и синтезу речи. Принятие статьи означает, что независимые рецензенты из мирового сообщества проверили и подтвердили результаты. Это научная верификация, а не просто маркетинговые заявления.
Можно ли дообучить GigaAM на своих данных?
Да, MIT-лицензия это разрешает. Сбер сами показали это на примере башкирского и грузинского — взяли один публичный датасет и получили качество в 3 раза лучше Whisper.
Где взять датасет TimeGround-1M?
Сбер опубликовал его в открытом доступе вместе с релизом. Ссылка на arXiv и GitHub репозиторий: github.com/salute-developers/GigaAM.
ASR (Automatic Speech Recognition) — автоматическое распознавание речи. Программа слушает звук и превращает его в текст.
WER (Word Error Rate) — процент слов, которые модель распознала неправильно. 6% означает, что из 100 слов 6 ошибочные. Чем меньше — тем лучше.
Temporal grounding — способность модели найти в аудиозаписи конкретный момент по текстовому описанию. «Найди, где говорили о бюджете» → таймстемп.
IoU (Intersection over Union) — метрика точности temporal grounding. Насколько найденный отрезок совпадает с реальным. 100 = идеально, 0 = мимо.
MoE (Mixture of Experts) — архитектура языковой модели, где для каждого запроса активируется только часть параметров. Позволяет делать большие модели эффективными.
Conformer — архитектура нейросети для обработки звука, сочетающая свёрточные слои и self-attention. Хорошо работает на аудио.
HuBERT-CTC — метод самообучения для речевых моделей. Модель учится представлять звук без размеченных данных, что позволяет использовать огромные неразмеченные корпусы.
Low-resource языки — языки, для которых мало обучающих данных. Башкирский, грузинский, киргизский — типичные примеры. GigaAM показывает хорошую адаптацию к ним с минимальным дообучением.
MIT-лицензия — одна из самых свободных open-source лицензий. Разрешает использовать, изменять и распространять код, в том числе в коммерческих проектах, при условии сохранения указания авторства.
Cluster-level data balancing — метод Сбера для балансировки языков при обучении. Языки группируются по схожести, и обучение балансируется на уровне групп — чтобы редкие языки не «утонули» на фоне английского.
Код и веса — github.com/salute-developers/GigaAM. Научная статья — arXiv 2607.10371. Попробовать GigaChat Audio — giga.chat и @smartspeech_sber_bot. Разбор на Хабре — habr.com.
Смотрите каталог AI-инструментов на VibeCoderz — там собраны актуальные инструменты для работы с речью и аудио.
Вопросы по интеграции речевых моделей в свой продукт — к Максиму.
Обновлено: 14 июля 2026. Источники: arXiv, GitHub GigaAM, Хабр, iXBT.