TTS API — это сервис, который превращает текст в живой голос через обычный HTTP-запрос, без своего дата-центра и без записи диктора. Вайбкодеру он нужен там, где бот или приложение должны говорить, а не просто печатать текст в чат. Разберём подробно: чем платный ElevenLabs API отличается от Cartesia AI с задержкой до 90 мс, и почему Silero TTS, Piper и Kokoro TTS остаются бесплатным вариантом для тех, кто не готов платить за каждый символ.
В 2026 году синтез речи через API занимает от 20 минут до одного вечера. ElevenLabs и Cartesia AI дают готовый голос по запросу от 5-6 долларов в месяц, а Silero TTS, Piper и Kokoro TTS работают бесплатно и локально. Дальше — сравнение задержки, цен и код первого запроса.
Зачем вайбкодеру вообще нужен TTS API
TTS API нужен там, где встроенный голос браузера или телефона звучит как робот: в продукте, боте или контенте, который должен звучать живо.
Задержка меньше 300 мс решает, останется ли пользователь в разговоре с ботом. У Cartesia AI время до первого звука начинается от 40 мс, у флеш-моделей ElevenLabs — около 150-180 мс. Для статьи или подкаста этот показатель почти не важен. Для голосового агента, который отвечает по телефону, критичен.

Браузерный SpeechSynthesis API бесплатный, но голоса в нём звучат как читалка из 2010-х. Системный TTS на телефоне ограничен установленными голосами и не клонируется. TTS API решает обе проблемы: десятки естественных голосов, клонирование своего тона, стриминг аудио прямо во время генерации текста моделью.
Вайб-кодер обычно уже собрал обвязку продукта в Cursor или Claude Code. Добавить голос — это буквально один блок кода поверх готового бэкенда, не переписывание архитектуры.
Какой TTS API выбрать: облако или локальный движок
Выбор зависит от трёх вещей: нужна ли сверхнизкая задержка для диалога, готовы ли платить за каждую минуту речи и критична ли приватность текста.
Для звонящего голосового агента задержка важнее цены. Для аудиоверсии блога цена важнее задержки. Для медицинских или юридических текстов приватность может перевесить оба фактора, и тогда остаётся только локальный движок вроде Silero TTS.

| Сценарий | Что выбрать | Почему |
|---|---|---|
| Голосовой агент, звонки, реальный диалог | Cartesia AI | Задержка до 90 мс, стриминг под разговор в реальном времени |
| YouTube-озвучка, аудиокниги, подкасты | ElevenLabs API | Клонирование голоса, естественная интонация на длинных текстах |
| Бесплатный прототип, MVP без бюджета | Silero TTS | Бесплатно, офлайн, хорошее качество русской речи |
| Умный дом, Raspberry Pi, embedded | Piper | Компактный движок, работает на слабом железе |
| Self-hosted продукт с англоязычной аудиторией | Kokoro TTS | 82 млн параметров, лицензия Apache 2.0, дёшево в хостинге |
ElevenLabs API сколько стоит и как быстро подключить
ElevenLabs даёт лучшее качество голоса на рынке, но платит за это каждый, кто превышает бесплатный лимит: от 10 000 бесплатных символов в месяц до сотен долларов на проде.
По данным агрегаторов пеналти-планов ElevenLabs на август 2026 года, тарифы стартуют от Free (0 $), затем идут Starter, Creator, Pro, Scale и Business, а верхний потолок доходит почти до 1000 $ в месяц на тарифе Business<sup>[1]</sup>. Text-to-speech через API считается по символам: около 0,05 $ за 1000 символов на быстрых моделях Flash и Turbo, и вдвое дороже на модели Multilingual v2 с максимальным качеством<sup>[1]</sup>.

| Тариф | Цена в месяц | Что входит |
|---|---|---|
| Free | 0 $ | ~10 минут озвучки, без коммерческой лицензии |
| Starter | ~6 $ | Коммерческая лицензия, клонирование голоса |
| Creator | ~22 $ | ~100 минут озвучки, профессиональное клонирование |
| Pro | ~99 $ | ~500 минут, 44.1 kHz PCM для продакшена |
Как получить ключ и в чём слабые стороны ElevenLabs
Ключ создаётся за пару минут: раздел Developers в дашборде, вкладка API keys, кнопка создания ключа. Ключ показывается один раз, и если не скопировать его сразу, придётся генерировать новый. Хранить ключ нужно в переменных окружения, а не прямо в коде продукта.
Сильная сторона ElevenLabs — качество озвучки, которое разработчики сравнивают с работой профессиональных дикторов дубляжа. Слабая сторона — поддержка и условия лицензии: сервис оставляет за собой право использовать данные голоса даже после удаления аккаунта, и это стоит учитывать перед клонированием своего голоса или голоса клиента.
Максим: «GoBanana мы собрали за 3 часа после выхода новой модели, весь продукт занял 6-8 часов работы и принёс 12 миллионов рублей. TTS API работает по тому же принципу: не пишешь синтез речи с нуля, а подключаешь готовый блок и идёшь дальше.»
Cartesia AI правда ли задержка меньше 100 мс
Cartesia строит голосовую модель Sonic на архитектуре State Space Model, а не на трансформере, и заявляет задержку от 40 до 90 мс на старте генерации звука.
Amazon в феврале 2026 года добавил модель Sonic 3 от Cartesia в SageMaker JumpStart, отметив поддержку 42 языков и суб-100-миллисекундную задержку для голосовых агентов в реальном времени<sup>[2]</sup>. Это не маркетинговая цифра ради заголовка: в звонках с реальными людьми задержка в секунду ощущается как зависание связи, и человек кладёт трубку.

Из практики разработчиков голосовой инфраструктуры: даже небольшая задержка в один момент разговора рушит ощущение живого диалога, а решение проблемы лежит не в одной модели, а во всём стеке от инференса до телефонии. Именно поэтому Cartesia в 2026 году делает ставку на партнёрство с телефонной инфраструктурой вроде Twilio вместо попытки закрыть весь стек самостоятельно.
Для вайбкодера практический вывод простой. Если продукт это подкаст или закадровый текст, разница между 90 мс и 300 мс не почувствуется никогда. Если продукт это AI-агент поддержки, который отвечает голосом на звонок, каждая лишняя сотня миллисекунд у Cartesia AI — это меньше брошенных звонков.
Silero TTS правда бесплатный и без ограничений
Silero TTS — открытый движок на PyTorch с десятками голосов на русском, английском, немецком и других языках, работает офлайн и не требует подписки.
Сборки на основе Silero, вроде популярного среди русскоязычных разработчиков Demagog, дают больше сотни голосов сразу на нескольких языках и держатся на своём железе без интернета<sup>[3]</sup>. Разница с типичным бесплатным голосом Windows или голосовалкой Google слышна сразу: у Silero речь звучит естественно, у системных голосов — механически.
По сравнению с ручной озвучкой текста вслух, которая занимает 30 минут на статью, конвертация через Silero TTS укладывается в 3-4 минуты на том же объёме текста. Для длинных текстов это разница на порядок, а для вайбкодера, который клепает MVP по вечерам, счёт идёт на такие минуты.
Как быстро запустить Silero TTS локально
Для работы движку нужны Python и PyTorch. Дальше берётся готовый сервер, который поднимается парой команд в консоли, а голос проверяется отдельным скриптом синтеза без полной конвертации всего текста. Это удобно, когда нужно быстро прослушать, как звучит ударение в конкретном слове, прежде чем гнать через движок весь файл.
Отдельно стоит настроить словари: они превращают числа и смешанный текст на латинице и кириллице в читаемую речь, без словаря Silero может «съесть» цифры или прочитать аббревиатуру по буквам неправильно. Количество потоков обработки тоже стоит увеличить вручную под многоядерный процессор, иначе движок использует одно ядро и синтез идёт медленнее, чем мог бы.
Отдельный кейс — запуск Silero TTS как сервера для умного дома: сервис поднимается локально и подключается к Home Assistant как источник голоса для медиаплеера, а голоса Silero в этой связке часто звучат приятнее голосов по умолчанию у конкурирующего движка Piper.
Piper и Kokoro TTS для локального проекта что выбрать
Piper компактнее и быстрее на слабом железе вроде Raspberry Pi, Kokoro TTS звучит естественнее и подходит для облачного self-hosted продукта на английском языке.
Piper, открытая разработка Майкла Хэнсона, оптимизирован именно под слабые устройства и уже встроен в Home Assistant как штатный голосовой движок. На Raspberry Pi 4 он тянет генерацию речи ощутимо быстрее, чем конкурирующие движки на Raspberry Pi 3, а работает через стандартный ввод, то есть текст просто передаётся в программу без сложного API.
Kokoro TTS — модель всего на 82 миллиона параметров с открытой лицензией Apache 2.0, при этом по качеству звучания сравнима с куда более тяжёлыми моделями<sup>[4]</sup>. Из-за компактного размера Kokoro дёшево хостить: рыночная цена в облачных провайдерах держится около 0,006 $ за минуту синтезированной речи, что дешевле почти любого платного TTS API на рынке.

| Движок | Размер / требования | Языки | Где использовать |
|---|---|---|---|
| Silero TTS | PyTorch, средние ресурсы | RU, EN, DE, ES, FR, PT | Десктоп-приложения, серверы, умный дом |
| Piper | Легковесный, C++ | 30+ языков через модели | Raspberry Pi, embedded, офлайн-ассистенты |
| Kokoro TTS | 82M параметров, GPU опционально | В основном EN, растущий список | Self-hosted API, дешёвый облачный хостинг |
Полностью офлайн-ассистент на Raspberry Pi 5 сегодня реально собрать из Whisper для распознавания речи, локальной модели через Ollama и Piper для голоса, и всё это работает без единого запроса в интернет. Прикинуть архитектуру такого продукта можно за один вечер, а собрать рабочий прототип за выходные.
Как подключить TTS API за один вечер пошагово
Пять шагов от выбора движка до рабочего голоса в продукте: выбор сервиса, ключ доступа, установка SDK, первый запрос и обработка потокового аудио.

Шаг 1. Выбрать движок под задачу. Диалоговый бот с реальным временем — Cartesia AI. Контент без диалога в реальном времени — ElevenLabs. Нулевой бюджет — Silero TTS или Piper.
Шаг 2. Получить API-ключ. В личном кабинете сервиса находится раздел разработчика, там создаётся ключ и сразу копируется в защищённое место. Повторно ключ полностью уже не показывается ни у одного из платных сервисов.
Шаг 3. Установить SDK. У большинства сервисов есть готовый Python или Node SDK, который ставится одной командой через пакетный менеджер. Ключ загружается из переменных окружения, а не пишется прямо в код.
Шаг 4. Отправить первый запрос. Минимальный пример на Python:
import os
from elevenlabs import ElevenLabs
client = ElevenLabs(api_key=os.environ["ELEVENLABS_API_KEY"])
audio = client.text_to_speech.convert(
voice_id="выбранный_голос",
text="Привет, это тестовая озвучка продукта.",
model_id="eleven_flash_v2_5"
)Шаг 5. Настроить стриминг. Для диалоговых сценариев аудио нужно проигрывать частями по мере генерации, а не ждать полный файл — это и даёт ощущение той самой задержки в десятки, а не сотни миллисекунд.
Сколько стоит TTS API в 2026 году что выбрать под бюджет
Платные API стоят от 5-6 долларов в месяц за небольшой объём, self-hosted движки бесплатны, но требуют своего сервера или локальной машины для расчётов.
| Решение | Стоимость | Разовые затраты |
|---|---|---|
| ElevenLabs API | от ~0,05 $ за 1000 символов | Нет, оплата по подписке или по факту |
| Cartesia AI | Тарифы по минутам синтеза | Нет |
| Kokoro TTS (хостинг) | ~0,006 $ за минуту | Нет, дешевле облачных конкурентов |
| Silero TTS / Piper | Бесплатно | Своя машина или сервер под нагрузку |
Честная оговорка: бесплатные движки не бесплатны полностью, если считать электричество и амортизацию сервера под постоянную нагрузку. Для прототипа и малого трафика разница не заметна. Для продукта с тысячами запросов в день self-hosted решение может выйти дороже облачного API из-за железа, которое надо держать включённым круглосуточно.
Сильные и слабые стороны TTS API для продукта
Сильная сторона облачных TTS API — время запуска. Регистрация, ключ, первый запрос — и голос уже в продукте, без обучения моделей и без своего GPU-сервера. Это ровно то, что нужно вайбкодеру, который хочет протестировать гипотезу за вечер, а не за спринт.
Слабая сторона — зависимость от чужого сервиса и его условий использования. Цена растёт с трафиком, а лицензия на клонированный голос иногда остаётся у платформы даже после удаления аккаунта, как в случае ElevenLabs. Открытые движки вроде Silero TTS и Piper снимают эту зависимость, но перекладывают на разработчика инфраструктуру и поддержку сервера.
Часто задаваемые вопросы про TTS API
Какой TTS API самый дешёвый для старта? Бесплатнее всего Silero TTS и Piper, они не берут денег за символы или минуты, потому что работают на вашем железе. Из платных сервисов самый доступный вход у ElevenLabs Starter, около 6 долларов в месяц.
Можно ли использовать Silero TTS в коммерческом продукте? Да, движок с открытой лицензией, и русскоязычные разработчики уже строят на нём коммерческие продукты. Стоит свериться с актуальной версией лицензии на странице проекта перед релизом.
Чем Cartesia AI лучше ElevenLabs для голосового бота? Ниже задержка до первого звука, около 40-90 мс против 150-180 мс у быстрых моделей ElevenLabs. Для диалога в реальном времени это ощутимая разница, для аудиоконтента без диалога — нет.
Работает ли Kokoro TTS с русским языком? Основной фокус модели на английском и ещё нескольких языках, полноценной русской озвучки на уровне Silero TTS пока нет. Для русскоязычного продукта Silero остаётся более практичным выбором.
Нужен ли GPU для запуска Piper или Silero TTS? Нет, оба движка спокойно работают на CPU, а Piper специально оптимизирован под слабые устройства вроде Raspberry Pi. GPU ускоряет генерацию, но не обязателен для запуска.
Сколько времени займёт интеграция TTS API в готовый продукт? При выборе облачного сервиса вроде ElevenLabs или Cartesia реально уложиться в один вечер: ключ, SDK, первый запрос. Локальный движок вроде Silero TTS добавляет время на настройку сервера, обычно час-два сверху.
Что выбрать для звонящего AI-агента на русском языке? Связку из Silero TTS для голоса и любой модели распознавания речи, если критична приватность звонков, либо Cartesia AI, если приоритет — минимальная задержка и не важна локализация данных.
Глоссарий
TTS (Text-to-Speech) — технология преобразования текста в аудио с речью. API синтеза речи — способ получить голос через запрос к серверу, без своей инфраструктуры для генерации. Латентность (задержка) — время от отправки текста до появления первого звука в ответе. Стриминг аудио — передача звука частями по мере генерации, а не единым файлом после полной обработки. Voice cloning (клонирование голоса) — создание синтетического голоса на основе образца записи реального человека. Self-hosted движок — TTS-модель, которая работает на собственном сервере разработчика, без внешнего API. SSM (State Space Model) — архитектура нейросети, на которой построена модель Sonic от Cartesia, альтернатива трансформерам.
Что дальше
Для голосового продукта одного TTS часто мало: нужен ещё бот-логика, распознавание речи и хостинг. Актуальные обзоры инструментов для сборки такого стека собраны в каталоге AI-инструментов VibeCoderz, а если продукт заточен под конкретную профессию, загляните в каталог AI-агентов — там уже разобраны готовые ниши под голосовых ассистентов.
Если нужна помощь с архитектурой конкретного продукта на TTS API, разбор ниши или выбор движка под бюджет, пишите Максиму напрямую: t.me/maxnagovitsyn.
Источники: [1] flexprice.io, обзор тарифов ElevenLabs, август 2026. [2] aws.amazon.com, анонс Cartesia Sonic 3 на SageMaker JumpStart, февраль 2026. [3] обзор Demagog на базе Silero TTS, YouTube. [4] huggingface.co, карточка модели Kokoro-82M.
Обновлено: август 2026.