LiveKit Agents — open source фреймворк для голосовых AI-агентов на Python, который в версии 1.5.x получил нативную поддержку MCP и адаптивные прерывания. В отличие от managed-платформ вроде Vapi или Retell, тут вы сами выбираете STT, LLM и TTS и сами платите только за их реальную стоимость. Ниже — рабочий стек, порог выгодности self-hosted и пример кода агента.
LiveKit Agents 1.5.x (апрель 2026) добавил ML-модель адаптивных прерываний и встроенный MCP. Рекомендуемый стек для старта: Deepgram для распознавания речи, GPT-4o mini как LLM, Cartesia Sonic 3 для синтеза. Self-hosted выгоднее managed-платформ примерно от 10 000 минут разговора в месяц. Дальше — код, цифры и таблица сравнения с Vapi и Retell.
Что такое LiveKit Agents и чем он отличается от Vapi
LiveKit Agents — это open source фреймворк, где вы пишете код агента сами, а Vapi и Retell дают готовую конструкцию через UI и берут комиссию за каждую минуту разговора.
Vapi и Retell — managed-оркестраторы: вы описываете агента, а они запускают распознавание речи, LLM, синтез, телефонию и определение окончания хода за вас. LiveKit и Pipecat — фреймворки, которые вы разворачиваете сами: получаете production-grade real-time ядро и пайплайн-примитивы, а всё остальное строите сверху. Разница простая: Vapi — конструктор, LiveKit — конструктор без готовых деталей.
LiveKit Agents — открытый фреймворк для построения полностью кастомных голосовых (и видео) агентов, рассчитанный на разработчиков, которым нужен voice-агент под нестандартную задачу. Vapi устроен иначе: закрытое решение под ключ, заточенное под типовые сценарии голосовых продуктов, с ограниченной кастомизацией под разработчика. Кто-то в комьюнити сравнивает LiveKit с конструктором Lego — детали есть, а собирать нужно самому.
Ядро LiveKit — сервер на WebRTC. Участники (люди и агенты) подключаются к «комнате» и обмениваются треками — аудио, видео или произвольными данными. Сервер открытый и лицензирован по Apache 2.0, так что можно развернуть его хоть на своём VPS, хоть в LiveKit Cloud.

Что нового в версии 1.5.x: MCP и адаптивные прерывания
Главные апдейты 1.5.x — модель адаптивных прерываний, которая отличает реальное «дайте я скажу» от случайного «ммм», и нативная поддержка MCP без отдельной интеграции под голос.
Модель адаптивных прерываний включена по умолчанию в Python Agents с версии 1.5.0 и в TypeScript Agents с версии 1.2.0. Каждый агент, развёрнутый в LiveKit Cloud, получает её автоматически без необходимости разворачивать и обслуживать дополнительные модели. До этого голосовые агенты первого поколения обрывали свою реплику на любой звук, включая кашель или «угу».
Backchanneling — это короткие реплики слушателя вроде «угу», «ладно» или «понял», которые показывают внимание, но не требуют ответа. Отфильтровывая их, агент избегает лишней смены хода из-за коротких подтверждений, случайных звуков или фонового шума.
Второе крупное изменение — MCP. Native-поддержка MCP позволяет подключить инструменты с MCP-сервера буквально одной строкой кода. Практически это значит: голосовой агент подключается к тем же MCP-серверам, что и Cursor или Claude Code — единый набор инструментов вместо отдельной обвязки под голос. Раньше для той же задачи собирали отдельный workflow на Zapier или Make для каждой функции агента — новая почта, новая запись в CRM, новая встреча в календаре — теперь один MCP-сервер закрывает все три сценария разом.

Какой стек выбрать для старта на Python
Для первого прототипа берём Deepgram Nova на распознавание, GPT-4o mini как LLM для логики диалога и Cartesia Sonic 3 на синтез — баланс скорости и цены, которого хватает для 90% сценариев.
Deepgram Nova хорош тем, что умеет endpointing — сам определяет паузу и понимает, что человек договорил, без ручной настройки таймаутов. GPT-4o mini выбран не потому что самый умный, а потому что достаточно быстрый для реального времени и не разоряет на токенах при постоянном диалоге. Cartesia Sonic 3 держит время до первого звука в районе 166–190 мс в реальных условиях — цифра в 90 мс, которую часто указывают в маркетинге, это лабораторный показатель самой модели без учёта сети, и путать их не стоит.
По деньгам: Cartesia берёт 1 кредит за символ синтеза, тарифы — от бесплатного (20 000 кредитов) до Scale за $299 в месяц с 8 миллионами кредитов, что в пересчёте даёт примерно $5–37 за миллион символов. Если латентность синтеза важнее цены — берите Sonic Turbo, если наоборот — смотрите Deepgram Aura-2, который дешевле при похожей скорости.
Пример минимального агента на Python:
from livekit.agents import AgentSession, Agent
from livekit.plugins import deepgram, openai, cartesia, silero
async def entrypoint(ctx):
session = AgentSession(
stt=deepgram.STT(model="nova-3"),
llm=openai.LLM(model="gpt-4o-mini"),
tts=cartesia.TTS(model="sonic-3"),
vad=silero.VAD.load(),
)
await session.start(
agent=Agent(instructions="Отвечай кратко, по делу, дружелюбно."),
room=ctx.room,
)Это скелет — три плагина подключаются декларативно, а LiveKit сам синхронизирует потоки аудио между ними.

Когда self-hosted LiveKit выгоднее managed-платформ
Экономически self-host окупается примерно от 10 000–20 000 минут разговора в месяц — ниже этого объёма содержание своей инфраструктуры съедает всю экономию на комиссии.
До 10 тысяч минут в месяц выгоднее оставаться на managed-платформе, между 10 и 50 тысячами — имеет смысл гибридная схема, а выше 50 тысяч минут переход на LiveKit или Pipecat экономит 60–80% на стоимости минуты, но с этого момента вы сами отвечаете за латентность, телефонию и аптайм. Похожую границу называет и другой источник: Vapi дешевле на низких объёмах, потому что не берёт фиксированную ежемесячную плату, а LiveKit выигрывает примерно с 1 000 минут в месяц за счёт своего тарифа в $0.01 за минуту агента после базовых $50, что перебивает ставку Vapi в $0.05 за минуту хостинга.
Порог зависит от того, как вы считаете время инженера. Если у вас в команде уже есть человек, который умеет в Python и телефонию — self-host окупается раньше. Если такого человека нет, первые пару месяцев managed-платформа выйдет дешевле по факту, даже с более высоким тарифом за минуту.

LiveKit или Vapi или Retell — что выбрать
Vapi — быстрый старт и лучшая интеграция с Twilio, Retell — жёстко зашитый workflow-билдер с сильной аналитикой звонков, LiveKit — полный контроль над стеком и данными для тех, кому это критично.
Vapi подходит большинству случаев: лучшая интеграция с Twilio, самый чистый developer experience, самый широкий выбор моделей и голосов. Retell стоит брать, если важнее самый проработанный конструктор workflow и плотно связанная аналитика звонков, а не гибкость в выборе моделей — например, подставить конкретную версию Claude или конкретный голос Cartesia в Retell сложнее, чем в Vapi.
| Критерий | Vapi | Retell | LiveKit Agents |
|---|---|---|---|
| Модель | Managed, закрытый | Managed, закрытый | Open source, self-host |
| Цена за минуту | $0.05–0.13, до $0.33 с BYOK | Flat $0.07 | Раскладка по факту: STT+LLM+TTS+compute |
| Порог выгодности | До ~10–20К мин/мес | До ~10–20К мин/мес | От ~10–20К мин/мес |
| Кастомизация стека | Средняя | Ниже, чем у Vapi | Полная |
| MCP | Через интеграции | Через интеграции | Нативно, 1.5.x |
| Кому подходит | Быстрый запуск, агентство | Опинионированный workflow, аналитика | Контроль, суверенность данных, масштаб |
LiveKit стоит выбирать, если нужна HIPAA-совместимость, самостоятельно хостинг моделей, либо вы уже на масштабе, где важна стоимость минуты — а VAPI, если нужно запустить за дни, а не недели, и вы готовы работать с managed-инфраструктурой.

С какими трудностями столкнётся вайбкодер без опыта в Python
Порог входа выше, чем у Vapi или Retell: нужен рабочий Python, понимание async-кода и телефонии, а не только промпт-инжиниринг.
Максим: «Мог просто засесть до пяти ночи и просто там править одну какую-то функцию, которая не работала. Если бы не терпение — в моменте я уже испотел, и мне хотелось просто всё это закрыть. Но я понимал, что это можно решить и нужно решить, чтобы идти дальше.»
С LiveKit это ровно та ситуация. Deepgram, LLM и Cartesia работают асинхронно и параллельно — если один из трёх потоков не синхронизирован, агент либо молчит, либо перебивает сам себя. Дебажить это сложнее, чем поправить промпт в UI Vapi. Зато когда всё встало на место — вы получаете стек, который целиком у вас: свой сервер, свои данные, своя цена за минуту без чужой наценки.

FAQ
Что такое LiveKit Agents простыми словами?
Это open source фреймворк на Python и Node.js для создания голосовых и видео AI-агентов. Вы сами выбираете STT, LLM и TTS-провайдеров и разворачиваете либо на LiveKit Cloud, либо на своих серверах.
Нужно ли знать Python, чтобы начать?
Да, базовый уровень обязателен: async-функции, работа с переменными окружения, понимание того, как ставятся пакеты через pip. Без этого проще начать с Vapi или Retell.
Сколько стоит LiveKit Cloud?
Есть бесплатный тариф с базовым лимитом трафика, дальше — платные планы с оплатой по факту использования. Дополнительно оплачиваются подключённые STT, LLM и TTS у сторонних провайдеров.
Можно ли подключить Claude вместо GPT-4o mini?
Да, LLM-плагин меняется одной строкой. Выбор GPT-4o mini в базовом стеке — вопрос скорости и цены для диалогов в реальном времени, а не единственно верный вариант.
Работает ли MCP в LiveKit Agents с версии 1.5.x на реальных задачах?
Да, поддержка MCP нативная, без отдельной обвязки: агент подключается к MCP-серверу и получает доступ к его инструментам одной строкой конфигурации.
Чем адаптивные прерывания лучше обычного VAD?
Обычный VAD реагирует на любой звук — кашель, «угу», фоновый шум. Адаптивная модель различает, хочет ли человек реально перебить агента или просто издал случайный звук, и не обрывает реплику зря.
С какого объёма звонков имеет смысл переходить на self-hosted LiveKit?
Ориентир — 10 000–20 000 минут разговора в месяц. Ниже этого порога зарплата инженера на поддержку инфраструктуры съедает экономию на комиссии платформы.
Глоссарий
- STT (Speech-to-Text) — распознавание речи, превращение голоса в текст.
- TTS (Text-to-Speech) — синтез речи, превращение текста в аудио.
- TTFA (Time To First Audio) — время до первого звука ответа, ключевая метрика для ощущения «живого» диалога.
- MCP (Model Context Protocol) — протокол, через который агент подключается к внешним инструментам без отдельной интеграции под каждый из них.
- Endpointing — момент, когда система понимает, что человек закончил говорить.
- Adaptive interruption handling — модель, отличающая настоящее прерывание от случайного звука или короткой реплики-подтверждения.
Дальше по теме — сравнение Vapi, Retell и LiveKit, а если ищете готового AI-агента под свою профессию без написания кода — загляните в каталог агентов VibeCoderz. Если нужна помощь с выбором стека под конкретную задачу — запишитесь на консультацию к Максиму.
Обновлено: август 2026.