VibeCoderzVibeCoderz
Все статьи
2026/07/219 мин чтения

Сбер открыл GigaAM Multilingual и GigaChat Audio: распознаёт казахский лучше Whisper, помнит 2 часа разговора

14 июля 2026 Сбер выложил в открытый доступ сразу два речевых AI-продукта с MIT-лицензией — и это не «ещё один Whisper по-русски». GigaAM Multilingual обходит Whisper Large v3 на всех языках СНГ при меньшем размере модели. GigaChat Audio держит в пам…

Содержание (10)+

14 июля 2026 Сбер выложил в открытый доступ сразу два речевых AI-продукта с MIT-лицензией — и это не «ещё один Whisper по-русски». GigaAM Multilingual обходит Whisper Large v3 на всех языках СНГ при меньшем размере модели. GigaChat Audio держит в памяти до двух часов аудио и умеет находить конкретные моменты в длинных записях — задача, с которой западные модели просто не справляются.

Изображение

Обе работы приняты на Interspeech 2026 — главную международную конференцию по распознаванию речи.

Сбер открыл GigaAM Multilingual (MIT, WER 6.4% на русском vs 9.4% у Whisper, поддержка казахского/киргизского/узбекского) и GigaChat Audio (temporal grounding, 2 часа контекста, IoU 48.3 на длинных записях). Оба проекта на GitHub. В статье: что умеют, цифры, где скачать, для каких задач подходит.

Ссылки:


Зачем это нужно — проблема, которую решали годами

Whisper от OpenAI — сейчас стандарт для распознавания речи в большинстве приложений. Он хорошо работает на английском, сносно на русском. Но если тебе нужен казахский, киргизский или узбекский — Whisper справляется заметно хуже. А если запись длиннее 30 минут — начинает «плыть» и терять нить.

Для России и СНГ это конкретная проблема. Звонки в колл-центре на казахском. Совещание на два часа, из которого нужно вытащить конкретное решение. Голосовые сообщения на узбекском в корпоративном мессенджере.

Сбер занимается речевым AI давно — с 2020 года, когда вышел первый GigaAM. Сейчас они открывают четвёртое поколение этой работы: модель, обученную на 2 миллионах часов речи на 70+ языках, и языковую модель, которая работает напрямую со звуком и помнит двухчасовой разговор целиком.


GigaAM Multilingual — что это такое простыми словами

Представь, что ты диктуешь текст в телефон. Телефон должен понять твои слова и превратить их в текст. Это называется распознавание речи, или ASR (automatic speech recognition).

Изображение

Качество измеряется показателем WER — Word Error Rate. Это процент слов, которые модель распознала неправильно. Чем меньше — тем лучше. WER 6% означает, что из 100 слов модель ошиблась примерно в 6.

GigaAM Multilingual на русском языке: WER 6.4%. Whisper Large v3 — 9.4%. Это значит, что GigaAM ошибается примерно в полтора раза реже. На длинных текстах разница ощущается очень явно.

На казахском, киргизском и узбекском разрыв ещё больше — потому что Whisper учили преимущественно на английском, и языки СНГ для него «боковые». GigaAM учили специально с балансировкой: ни один язык не доминирует над другими.

Цифры — вся таблица

Метрика — WER (чем меньше, тем лучше):

ЯзыкGigaAM 240MGigaAM 600MWhisper Large v3Omnilingual 1B
Английский19.114.416.724.5
Русский6.44.69.411.8
Казахский13.712.317.119.0
Киргизский10.29.413.413.6
Узбекский11.710.513.814.2
Среднее12.210.214.116.6

240M-версия GigaAM обходит Whisper Large v3 (1.55 млрд параметров) при размере в 7 раз меньше.

Особенно интересно: башкирский и грузинский

Изображение

Это так называемые low-resource языки — данных для обучения мало. Сбер взял один публичный датасет (Common Voice) и дообучил модель. Результат:

ЯзыкGigaAMWhisper Large v3
Башкирский3.6%11.1%
Грузинский3.8%13.4%

GigaAM ошибается в 3 раза реже при одинаковых входных данных для обучения. Это значит, что модель хорошо «переносит» знания между языками — важное свойство для работы с редкими языками, на которые нет большого датасета.

Как это устроено технически

Архитектура — Conformer-энкодер (220-240M параметров), предобученный на 2 млн часов речи методом HuBERT-CTC.

Ключевая инновация — cluster-level data balancing. Обычно когда учишь модель на многих языках, доминируют те, которых больше в данных — английский, испанский, русский. Остальные «тонут». Сбер решил это через кластеризацию языков по схожести: языки, близкие друг к другу (например, казахский и киргизский), группируются вместе, и обучение балансируется на уровне кластеров, а не отдельных языков. Именно поэтому модель хорошо работает даже на языках, которых в данных было мало.

Эволюция модели: v1 (2020) — 50K часов данных, v2 — HuBERT-CTC, v3 — 700K часов, +30% качества на новых доменах. Multilingual — 2M часов, 70+ языков.


GigaChat Audio — языковая модель, которая слышит

Это другой продукт с другой задачей.

GigaAM Multilingual — это «уши»: переводит звук в текст. GigaChat Audio — это «уши + мозг»: слышит звук и понимает его содержание, не превращая в текст как промежуточный шаг.

Изображение

Зачем это нужно

Обычный пайплайн при работе с аудио: запись → расшифровка в текст → текст в LLM → ответ. На каждом шаге теряется что-то важное. Интонация исчезает при расшифровке. Пауза, которая говорит «человек нервничает», превратилась в три точки. Смех в конце фразы стал просто пробелом.

GigaChat Audio работает напрямую со звуком — без промежуточной расшифровки. Это значит, что она слышит не только слова, но и то, как они сказаны.

Что умеет

  • Распознаёт слова — базовый ASR
  • Слышит эмоции — злится человек, расстроен, радуется — анализирует прямо по голосу
  • Помнит до 2 часов разговора — не теряет нить длинной записи
  • Отвечает на вопросы по записи — «что решили на 45-й минуте?»
  • Находит конкретные моменты — temporal grounding, разбираем отдельно

Temporal grounding — самая важная фича

Изображение

Temporal grounding — это когда модель находит конкретный момент в аудиозаписи по текстовому описанию. Звучит абстрактно, поэтому давай конкретный пример.

Ты записал двухчасовое совещание. Тебе нужно найти, где именно обсуждали сроки сдачи проекта. Вместо того чтобы перематывать запись вручную — говоришь модели: «найди момент, когда говорили о дедлайне». Модель выдаёт таймстемп: «1:23:47 — 1:31:05».

Изображение

Это называется IoU (Intersection over Union) — метрика точности, насколько найденный интервал совпадает с реальным. 100 = идеально, 0 = промахнулся полностью.

МодельIoU на длинных записях (20-60 мин)
GigaChat Audio48.3
Voxtral~0
Phi-4~0
Qwen3-Omni~0

Конкуренты показывают около нуля. Не потому что они плохие — просто не умеют работать с длинными записями. Большинство моделей «теряются» после 30 минут аудио.

GigaChat Audio держит контекст до 2 часов благодаря архитектуре на базе GigaChat3.1-10B-A1.8B (MoE — mixture of experts) с интегрированным аудио-энкодером из GigaAM Multilingual.

Для обучения temporal grounding Сбер опубликовал датасет TimeGround-1M — тоже в открытом доступе.

Ещё один бенчмарк — RuBQ-Audio

Это тест на понимание и ответы на вопросы по-русски:

МодельRuBQ-Audio
GigaChat Audio60.0
Qwen3-Omni43.7

37% преимущества над ближайшим конкурентом.


Где уже работает прямо сейчас

В продакшне:

  • giga.chat — GigaChat-Max-Audio встроен в ГигаЧат. Можно прямо сейчас отправить голосовое сообщение или загрузить запись и поговорить с ней
  • @smartspeech_sber_bot — Telegram-бот для распознавания голосовых сообщений

В опенсорсе:

  • Веса GigaAM Multilingual — GitHub и HuggingFace
  • Датасет TimeGround-1M — в открытом доступе
  • Код и документация — MIT-лицензия, можно брать в коммерческие проекты

Для каких задач подходит

GigaAM Multilingual — когда нужно превратить звук в текст:

  • Расшифровка звонков колл-центра на русском, казахском, узбекском
  • Субтитры к видео для русскоязычной аудитории
  • Голосовой ввод в приложении — особенно если аудитория не только русскоязычная
  • Транскрипция интервью, подкастов, лекций
  • Дообучение под свой домен (MIT — можно всё)

GigaChat Audio — когда нужно понять содержание аудио:

  • Поиск конкретных моментов в длинных записях (совещания, переговоры)
  • Анализ эмоционального тона в записях звонков
  • Суммаризация двухчасового совещания в три абзаца
  • Вопросы-ответы по записи: «что решили по вопросу X?»
  • Мониторинг тональности в голосовой поддержке
Максим: «У меня был случай — нужно было разобрать запись полуторачасовых переговоров, найти конкретно момент, где обсуждали условия. Обычно это час работы вручную. Попробовал GigaChat Audio — нашёл нужный фрагмент за минуту. Для B2B-продаж и переговоров это реально меняет рабочий процесс.»

Почему это важно для российского рынка

Whisper и другие западные модели создавались в первую очередь для английского языка. Русский там есть, но не как приоритет. Казахский, киргизский, узбекский — ещё более боковые.

При этом в России и СНГ огромное количество речевых задач: колл-центры, юридическая транскрипция, образование на нескольких языках, государственные сервисы. До сих пор приходилось выбирать: либо использовать западные модели с посредственным качеством на родных языках, либо платить за дорогие закрытые решения.

GigaAM Multilingual — это первая открытая модель, которая обучена специально с учётом языков СНГ, превосходит Whisper на этих языках и при этом MIT-лицензия. Берёшь, встраиваешь, адаптируешь.

Отдельно важно: обе работы приняты на Interspeech 2026 — это не маркетинг Сбера, а научная верификация. Независимые рецензенты из мирового сообщества speech AI оценили и приняли.


Честно про ограничения

GigaAM Multilingual:

Английский — не главный приоритет, и это видно: 19.1% WER (240M-версия) против 16.7% у Whisper. Если нужен английский — берите Whisper. Если приоритет СНГ-языки — берите GigaAM.

Модель большая (240M и 600M параметров) — для запуска на мобильном устройстве нужна квантизация или дистилляция.

GigaChat Audio:

IoU 48.3 — хороший результат для задачи, которую конкуренты вообще не решают. Но это не 90%+. На записях с шумом, перебивками или быстрой сменой темы точность будет ниже.

2 часа контекста — у GigaChat Audio. GigaChat-Max-Audio в продакшне держит до 3 часов. Для ещё более длинных записей — чанковать.

Аудио-native модели в целом медленнее текстовых. Ждать результата для длинной записи дольше, чем для расшифровки + текстового запроса.


Как начать прямо сейчас

Попробовать без установки:

  1. Открой giga.chat
  2. Отправь голосовое сообщение или загрузи аудиофайл
  3. Спроси что-нибудь по содержанию

Или через Telegram:

Скачать модель для своего проекта:

# GitHub
git clone https://github.com/salute-developers/GigaAM

# Или через HuggingFace
pip install gigaam

MIT-лицензия — подходит для коммерческих проектов.


FAQ

GigaAM Multilingual — это бесплатно?
Да. MIT-лицензия, открытые веса, можно использовать в коммерческих проектах без ограничений.

Чем GigaAM лучше Whisper на русском?
WER 6.4% против 9.4% у Whisper Large v3 — ошибается примерно в полтора раза реже. На длинных текстах это очень заметно.

Поддерживает ли GigaAM азербайджанский и другие языки СНГ?
Предобучен на 70+ языках, но явные бенчмарки опубликованы по русскому, казахскому, киргизскому, узбекскому, башкирскому и грузинскому. Другие языки — в зависимости от их наличия в предобучающем корпусе.

GigaChat Audio работает в реальном времени?
В текущих публичных демо — асинхронный режим (загружаешь файл, получаешь ответ). Real-time streaming — отдельная задача, публично не анонсирована.

Что такое Interspeech и почему важно, что статьи приняты туда?
Interspeech — главная международная конференция по распознаванию и синтезу речи. Принятие статьи означает, что независимые рецензенты из мирового сообщества проверили и подтвердили результаты. Это научная верификация, а не просто маркетинговые заявления.

Можно ли дообучить GigaAM на своих данных?
Да, MIT-лицензия это разрешает. Сбер сами показали это на примере башкирского и грузинского — взяли один публичный датасет и получили качество в 3 раза лучше Whisper.

Где взять датасет TimeGround-1M?
Сбер опубликовал его в открытом доступе вместе с релизом. Ссылка на arXiv и GitHub репозиторий: github.com/salute-developers/GigaAM.


Глоссарий

ASR (Automatic Speech Recognition) — автоматическое распознавание речи. Программа слушает звук и превращает его в текст.

WER (Word Error Rate) — процент слов, которые модель распознала неправильно. 6% означает, что из 100 слов 6 ошибочные. Чем меньше — тем лучше.

Temporal grounding — способность модели найти в аудиозаписи конкретный момент по текстовому описанию. «Найди, где говорили о бюджете» → таймстемп.

IoU (Intersection over Union) — метрика точности temporal grounding. Насколько найденный отрезок совпадает с реальным. 100 = идеально, 0 = мимо.

MoE (Mixture of Experts) — архитектура языковой модели, где для каждого запроса активируется только часть параметров. Позволяет делать большие модели эффективными.

Conformer — архитектура нейросети для обработки звука, сочетающая свёрточные слои и self-attention. Хорошо работает на аудио.

HuBERT-CTC — метод самообучения для речевых моделей. Модель учится представлять звук без размеченных данных, что позволяет использовать огромные неразмеченные корпусы.

Low-resource языки — языки, для которых мало обучающих данных. Башкирский, грузинский, киргизский — типичные примеры. GigaAM показывает хорошую адаптацию к ним с минимальным дообучением.

MIT-лицензия — одна из самых свободных open-source лицензий. Разрешает использовать, изменять и распространять код, в том числе в коммерческих проектах, при условии сохранения указания авторства.

Cluster-level data balancing — метод Сбера для балансировки языков при обучении. Языки группируются по схожести, и обучение балансируется на уровне групп — чтобы редкие языки не «утонули» на фоне английского.


Код и веса — github.com/salute-developers/GigaAM. Научная статья — arXiv 2607.10371. Попробовать GigaChat Audio — giga.chat и @smartspeech_sber_bot. Разбор на Хабре — habr.com.

Смотрите каталог AI-инструментов на VibeCoderz — там собраны актуальные инструменты для работы с речью и аудио.

Вопросы по интеграции речевых моделей в свой продукт — к Максиму.


Обновлено: 14 июля 2026. Источники: arXiv, GitHub GigaAM, Хабр, iXBT.

All Posts

Автор

Елисавета Наговицына
Елисавета Наговицына

Предприниматель · Контент-маркетолог · SEO-стратег · AI-продуктолог

2026/07/21

400 000+ органических переходов за 3 месяца. Со-основатель GoBanana (231K пользователей, 12+ млн ₽ без рекламы) и NeuroScribe (65K пользователей). SEO/GEO-стратегии для AI-поисковиков, 1 700+ единиц контента, 17+ реализованных стратегий.

Об авторе →

Читать далее

📢 Новость

Claude Code: новый CLI-агент от Anthropic

Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.

2026/02/27
📝 Конспект

Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов

Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.

2026/02/28
📝 Конспект

YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026

Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.

2026/02/28
📝 Конспект

Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода

Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.

2026/02/28
📝 Конспект

Vk Fast Cash Strategy

Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех

2026/02/28