Распознавание речи в текст (STT, speech-to-text) превращает голосовое сообщение, звонок или видео в текстовый файл за секунды. Подключается это через готовый API двух-трех строк кода, без своей модели и без GPU на балансе. В статье разберем, чем Deep…
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
Об авторе →Claude Code: новый CLI-агент от Anthropic
Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.
Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов
Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.
YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026
Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.
Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода
Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.
Vk Fast Cash Strategy
Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех
Распознавание речи в текст (STT, speech-to-text) превращает голосовое сообщение, звонок или видео в текстовый файл за секунды. Подключается это через готовый API двух-трех строк кода, без своей модели и без GPU на балансе. В статье разберем, чем Deepgram отличается от Gladia по точности, скорости и цене, и дадим рабочий код для интеграции обоих сервисов.
Deepgram и Gladia — два самых используемых STT API для продакшна в 2026 году. Deepgram берет скоростью и ценой на батч-транскрипцию, Gladia — точностью на многоязычном и шумном аудио плюс диаризацией спикеров из коробки. В статье: сравнение по цифрам, две таблицы и готовый код на Python и curl.
Распознавание речи в текст — это технология, которая переводит звуковую волну голоса в письменный текст с помощью нейросети, обученной на миллионах часов аудио. Термин STT встречается почти везде, где в продукте есть голос: voice-бот поддержки, транскрибация созвонов, субтитры к видео, диктовка в заметках.
У Deepgram Nova-3 независимый бенчмарк дает WER 5,26% на чистой английской речи, у флагманской модели Gladia Solaria-3 — 6,4% на записях звонков (Earnings22 Cleaned AA). Оба показателя означают почти безошибочную транскрипцию на понятном аудио, разница проявляется на шуме и акцентах.

Для вайбкодера STT — это готовый кирпичик, а не задача для своей ML-модели. Собрать Telegram-бота, который слушает голосовое и отвечает текстом, реально за вечер: голосовой файл летит в API, через пару секунд возвращается транскрипт, дальше с ним работает обычная логика бота. Именно так в VibeCoderz устроен собственный пайплайн генерации смарт-конспектов: транскрипт YouTube-видео уходит в AI и превращается в готовую статью с разметкой по темам.

STT API принимает аудиофайл или поток звука, прогоняет его через модель распознавания и возвращает JSON с текстом, таймкодами и меткой говорящего. Работает в двух режимах: пакетном (batch) и потоковом (real-time).
В batch-режиме файл целиком загружается на сервер и обрабатывается за раз, это дешевле и точнее. В real-time аудио льется через WebSocket непрерывным потоком, и текст появляется с задержкой в доли секунды, что критично для голосовых ассистентов.

Batch подходит для подкастов, записей встреч, YouTube-видео — там результат не нужен мгновенно. Real-time нужен, когда бот должен ответить прямо во время разговора: колл-центр, голосовой ассистент, диктовка в реальном времени. Выбор режима напрямую влияет на цену: потоковая транскрипция почти всегда дороже пакетной на 30-80%, потому что сервер держит соединение открытым и обрабатывает звук частями.
Есть и третий путь — открытая модель Whisper от OpenAI, которую можно развернуть у себя на сервере. Распознавание речи через whisper бесплатно в плане лицензии, но требует своего GPU, DevOps-настройки и не дает готового API из коробки. Deepgram и Gladia, по сути, продают Whisper-класс качества как облачный сервис с SLA и поддержкой, поэтому для большинства продуктов быстрее и дешевле по времени разработки взять готовый API.
Deepgram Nova-3 сильнее на чистой английской речи и на шумных телефонных звонках. Gladia Solaria-3 выигрывает на многоязычном аудио, акцентах и разделении по спикерам.
По собственным тестам Gladia на записях реальных звонков (Earnings22) Solaria-3 показывает WER 6,4% против 12,0% у Deepgram на том же датасете. Deepgram, в свою очередь, лидирует в независимых замерах на чистом английском — 5,26% WER у Nova-3.

Тут честная оговорка: тесты Gladia — это тесты самой Gladia, к ним стоит относиться как к маркетингу с цифрами, а не к независимому арбитру. На своем аудио разница может оказаться другой. Прогнать пару сотен реальных файлов через оба API перед выбором — не лишняя трата часа.
Диаризация — это разметка, кто из спикеров что сказал. У Gladia диаризация встроена в базовый тариф, а по собственным замерам компании точность разделения спикеров (DER) примерно в 3 раза выше, чем у конкурентов. Для звонков в поддержку или подкастов с несколькими голосами это ощутимая разница в удобстве постобработки.
Deepgram лучше справляется с шумом на фоне и специфическими акцентами в разговорной речи — это подтверждает и разбор с YouTube-канала про транскрипционные сервисы: Gladia точнее ставит таймкоды и разделяет спикеров, Deepgram увереннее вытягивает смысл из зашумленного звонка с посторонними голосами.

Оба сервиса укладываются в отметку до 300 миллисекунд для потокового распознавания, разница на уровне архитектуры, а не на глаз пользователя.
Solaria у Gladia отдает первый частичный транскрипт примерно за 103 миллисекунды, финальный вариант чуть позже. Deepgram держит суммарную задержку потока ниже 300 миллисекунд и остается одним из самых быстрых игроков рынка.

Для голосового ассистента, который должен подхватывать реплику пользователя без неловкой паузы, оба варианта работают достаточно быстро. Разница ощутима только при высокой нагрузке в сотни параллельных потоков, где стоит смотреть уже не на среднюю задержку, а на процентиль p95 в реальных условиях своего трафика.
Цена держится в центах за час аудио, но батч и стриминг считаются по-разному, и у обоих сервисов есть бесплатный старт для теста.

| Провайдер | Batch, за час | Real-time, за час | Бесплатно на старте |
|---|---|---|---|
| Deepgram Nova-3 | $0,26 | $0,46 | $200 в кредитах |
| Gladia Starter | $0,61 | $0,75 | 50€ в кредитах |
| Gladia Growth (от объема) | от $0,20 | от $0,25 | — |
На объеме в 1000 минут аудио в месяц (около 16,7 часа) батч-транскрипция через Deepgram обойдется примерно в $4,3, через Gladia Starter — около $10,2. Если нужен real-time, Deepgram выйдет в $7,7, Gladia Starter — в $12,5. При росте объема Gladia Growth почти сравнивается с Deepgram, а иногда и обгоняет его по цене.
Отдельный момент для российской аудитории: оба сервиса принимают оплату только зарубежной картой. Без своей карты в валюте придется идти через реселлеров API или виртуальные карты, это стоит закладывать в бюджет отдельной строкой еще на этапе выбора провайдера.
Лиза: «Раньше руками разбирала по 15-20 видео на одну статью для канала. Написала скрипт: вставляешь ссылки, он сам транскрибирует и раскладывает по 15 критериям. Было 4 часа, стало 5,5 минуты, прикинь.»
Регистрация занимает пару минут и сразу дает $200 в кредитах на тесты, без банковской карты на старте.
Храните ключ в переменных окружения, а не в коде репозитория. Это правило одинаково работает что для Deepgram, что для любого другого платного API.

Ниже минимальный запрос, который отправляет аудиофайл и получает текст обратно.
curl \
--request POST \
--header 'Authorization: Token ВАШ_API_КЛЮЧ' \
--header 'Content-Type: audio/wav' \
--data-binary @audio.wav \
--url 'https://api.deepgram.com/v1/listen?model=nova-3&language=ru&punctuate=true'То же самое на Python:
import requests
url = "https://api.deepgram.com/v1/listen?model=nova-3&language=ru&punctuate=true"
headers = {
"Authorization": "Token ВАШ_API_КЛЮЧ",
"Content-Type": "audio/wav",
}
with open("audio.wav", "rb") as audio_file:
response = requests.post(url, headers=headers, data=audio_file)
text = response.json()["results"]["channels"][0]["alternatives"][0]["transcript"]
print(text)Параметр language=ru включает русскую модель, punctuate=true добавляет пунктуацию в готовый текст. Для потоковой транскрипции меняется только протокол на WebSocket, логика запроса остается такой же.
У Gladia похожая схема, только ключ передается в заголовке x-gladia-key, а не в Authorization.
curl -X POST https://api.gladia.io/v2/pre-recorded \
-H "x-gladia-key: ВАШ_API_КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"audio_url": "https://example.com/audio.mp3",
"diarization": true
}'Запрос возвращает идентификатор задачи, а сам транскрипт нужно забрать отдельным GET-запросом через пару секунд, когда обработка завершится. Такая двухшаговая схема типична для батч-режима: сначала ставите задачу в очередь, потом опрашиваете статус или подписываетесь на вебхук. Параметр diarization: true сразу включает разметку по спикерам без доплаты за отдельную фичу, в отличие от многих конкурентов.
Для быстрого прототипа код необязательно писать руками. В Cursor или Windsurf промт вида «напиши функцию для отправки аудио в Gladia API и получения транскрипта» закрывает интеграцию за пару минут, а собрать вокруг нее интерфейс на Lovable — вопрос вечера, как показывает пример с демо-приложением для Deepgram на том же принципе.
Выбор провайдера зависит от задачи больше, чем от общих рейтингов точности.

| Сценарий | Лучший выбор | Почему |
|---|---|---|
| Голосовой бот поддержки на шумной линии | Deepgram | Увереннее держит акценты и фоновый шум |
| Транскрипция звонков с разделением по ролям | Gladia | Встроенная диаризация с высокой точностью |
| Многоязычные звонки, код-свитчинг | Gladia | 100+ языков и переключение внутри фразы |
| Массовая батч-транскрипция подкастов | Deepgram | Ниже цена за час на объеме |
| Данные в ЕС и строгий комплаенс | Gladia | GDPR, HIPAA, SOC 2 на всех платных тарифах |
Для приложения поддержки, где важно не потерять голос клиента среди шума колл-центра, разумнее стартовать с Deepgram. Для продукта с диктовкой интервью, многоязычными встречами или юридическими протоколами лучше подходит Gladia — там встроенная диаризация и работа с акцентами экономят время на постобработке. Голосовому агенту для профессии из каталога VibeCoderz, например техподдержки, обе схемы подойдут одинаково, разница будет в деталях трафика.
Deepgram выигрывает по цене на объеме, по скорости обработки и по устойчивости к шуму на линии. Минус — часть функций вроде продвинутой аудио-аналитики продается отдельными надстройками поверх базовой транскрипции, и итоговый счет собирается из нескольких строк.
Gladia честнее по структуре тарифа: диаризация, многоязычность и определение спикеров уже включены в цену без доплат. Минус — базовый тариф Starter дороже за час, чем у Deepgram, и разница особенно заметна на небольших объемах, пока не подключен тариф Growth со скидкой за объем.

Можно ли бесплатно подключить распознавание речи онлайн? Да, оба сервиса дают бесплатный старт: Deepgram — $200 в кредитах, Gladia — 50€. Этого хватает на десятки часов тестовой транскрипции без карты на старте у большинства тарифов.
Работает ли распознавание речи через whisper без интернета? Открытую модель Whisper можно развернуть локально и гонять транскрипцию офлайн, но потребуется собственный GPU и настройка инфраструктуры. Deepgram и Gladia работают только через облако.
Какой язык лучше всего распознают эти API? Английский точнее всего у обоих провайдеров, поскольку на нем обучено больше данных. Русский язык поддерживается у Deepgram и Gladia, но точность на разговорной речи с акцентом обычно ниже, чем на четкой дикции.
Нужна ли своя карта для подключения Deepgram или Gladia? На старте достаточно бесплатных кредитов без карты у обоих сервисов. Для оплаты после исчерпания лимита понадобится карта, поддерживающая платежи в валюте.
Сколько по времени занимает интеграция STT в приложение? Базовая интеграция с одним запросом на транскрипцию занимает от 30 минут до пары часов, если делать это с помощью AI-ассистента в коде вроде Cursor. Более сложная логика с вебхуками и очередями обычно требует дня работы.
Чем real-time распознавание отличается от обычного? Real-time отдает текст почти сразу по мере поступления звука через постоянное соединение, обычная батч-транскрипция обрабатывает уже готовый файл целиком. Первое дороже и сложнее в реализации, второе проще и дешевле.
STT (speech-to-text) — технология перевода голоса в текст. WER (word error rate) — процент ошибок в распознанном тексте относительно оригинала, чем ниже, тем точнее модель. Диаризация — разметка транскрипта по говорящим спикерам. Batch-транскрипция — обработка уже готового аудиофайла целиком, без потоковой передачи. Real-time (потоковая) транскрипция — распознавание речи по мере поступления звука через постоянное соединение. Латентность — задержка между произнесенным словом и появлением его в тексте.
Прежде чем подключать STT в продакшн, стоит прогнать оба API на своих реальных записях: разница в точности сильно зависит от языка, шума и специфики вашего голосового трафика. Посмотреть готовые обзоры инструментов для вайбкодинга можно в каталоге VibeCoderz, а если нужна помощь с архитектурой голосового продукта, записывайтесь на консультацию к Максиму: t.me/maxnagovitsyn.
Обновлено: сентябрь 2026