VibeCoderzVibeCoderz
Все статьи
2026/08/187 мин чтения

LiveKit Agents: open source стек для голосовых агентов на Python

LiveKit Agents — open source фреймворк для голосовых AI-агентов на Python, который в версии 1.5.x получил нативную поддержку MCP и адаптивные прерывания. В отличие от managed-платформ вроде Vapi или Retell, тут вы сами выбираете STT, LLM и TTS и сами…

Содержание (8)+

LiveKit Agents — open source фреймворк для голосовых AI-агентов на Python, который в версии 1.5.x получил нативную поддержку MCP и адаптивные прерывания. В отличие от managed-платформ вроде Vapi или Retell, тут вы сами выбираете STT, LLM и TTS и сами платите только за их реальную стоимость. Ниже — рабочий стек, порог выгодности self-hosted и пример кода агента.

LiveKit Agents 1.5.x (апрель 2026) добавил ML-модель адаптивных прерываний и встроенный MCP. Рекомендуемый стек для старта: Deepgram для распознавания речи, GPT-4o mini как LLM, Cartesia Sonic 3 для синтеза. Self-hosted выгоднее managed-платформ примерно от 10 000 минут разговора в месяц. Дальше — код, цифры и таблица сравнения с Vapi и Retell.

Что такое LiveKit Agents и чем он отличается от Vapi

LiveKit Agents — это open source фреймворк, где вы пишете код агента сами, а Vapi и Retell дают готовую конструкцию через UI и берут комиссию за каждую минуту разговора.

Vapi и Retell — managed-оркестраторы: вы описываете агента, а они запускают распознавание речи, LLM, синтез, телефонию и определение окончания хода за вас. LiveKit и Pipecat — фреймворки, которые вы разворачиваете сами: получаете production-grade real-time ядро и пайплайн-примитивы, а всё остальное строите сверху. Разница простая: Vapi — конструктор, LiveKit — конструктор без готовых деталей.

LiveKit Agents — открытый фреймворк для построения полностью кастомных голосовых (и видео) агентов, рассчитанный на разработчиков, которым нужен voice-агент под нестандартную задачу. Vapi устроен иначе: закрытое решение под ключ, заточенное под типовые сценарии голосовых продуктов, с ограниченной кастомизацией под разработчика. Кто-то в комьюнити сравнивает LiveKit с конструктором Lego — детали есть, а собирать нужно самому.

Ядро LiveKit — сервер на WebRTC. Участники (люди и агенты) подключаются к «комнате» и обмениваются треками — аудио, видео или произвольными данными. Сервер открытый и лицензирован по Apache 2.0, так что можно развернуть его хоть на своём VPS, хоть в LiveKit Cloud.

Изображение

Что нового в версии 1.5.x: MCP и адаптивные прерывания

Главные апдейты 1.5.x — модель адаптивных прерываний, которая отличает реальное «дайте я скажу» от случайного «ммм», и нативная поддержка MCP без отдельной интеграции под голос.

Модель адаптивных прерываний включена по умолчанию в Python Agents с версии 1.5.0 и в TypeScript Agents с версии 1.2.0. Каждый агент, развёрнутый в LiveKit Cloud, получает её автоматически без необходимости разворачивать и обслуживать дополнительные модели. До этого голосовые агенты первого поколения обрывали свою реплику на любой звук, включая кашель или «угу».

Backchanneling — это короткие реплики слушателя вроде «угу», «ладно» или «понял», которые показывают внимание, но не требуют ответа. Отфильтровывая их, агент избегает лишней смены хода из-за коротких подтверждений, случайных звуков или фонового шума.

Второе крупное изменение — MCP. Native-поддержка MCP позволяет подключить инструменты с MCP-сервера буквально одной строкой кода. Практически это значит: голосовой агент подключается к тем же MCP-серверам, что и Cursor или Claude Code — единый набор инструментов вместо отдельной обвязки под голос. Раньше для той же задачи собирали отдельный workflow на Zapier или Make для каждой функции агента — новая почта, новая запись в CRM, новая встреча в календаре — теперь один MCP-сервер закрывает все три сценария разом.

Изображение

Какой стек выбрать для старта на Python

Для первого прототипа берём Deepgram Nova на распознавание, GPT-4o mini как LLM для логики диалога и Cartesia Sonic 3 на синтез — баланс скорости и цены, которого хватает для 90% сценариев.

Deepgram Nova хорош тем, что умеет endpointing — сам определяет паузу и понимает, что человек договорил, без ручной настройки таймаутов. GPT-4o mini выбран не потому что самый умный, а потому что достаточно быстрый для реального времени и не разоряет на токенах при постоянном диалоге. Cartesia Sonic 3 держит время до первого звука в районе 166–190 мс в реальных условиях — цифра в 90 мс, которую часто указывают в маркетинге, это лабораторный показатель самой модели без учёта сети, и путать их не стоит.

По деньгам: Cartesia берёт 1 кредит за символ синтеза, тарифы — от бесплатного (20 000 кредитов) до Scale за $299 в месяц с 8 миллионами кредитов, что в пересчёте даёт примерно $5–37 за миллион символов. Если латентность синтеза важнее цены — берите Sonic Turbo, если наоборот — смотрите Deepgram Aura-2, который дешевле при похожей скорости.

Пример минимального агента на Python:

from livekit.agents import AgentSession, Agent
from livekit.plugins import deepgram, openai, cartesia, silero

async def entrypoint(ctx):
    session = AgentSession(
        stt=deepgram.STT(model="nova-3"),
        llm=openai.LLM(model="gpt-4o-mini"),
        tts=cartesia.TTS(model="sonic-3"),
        vad=silero.VAD.load(),
    )
    await session.start(
        agent=Agent(instructions="Отвечай кратко, по делу, дружелюбно."),
        room=ctx.room,
    )

Это скелет — три плагина подключаются декларативно, а LiveKit сам синхронизирует потоки аудио между ними.

Изображение

Когда self-hosted LiveKit выгоднее managed-платформ

Экономически self-host окупается примерно от 10 000–20 000 минут разговора в месяц — ниже этого объёма содержание своей инфраструктуры съедает всю экономию на комиссии.

До 10 тысяч минут в месяц выгоднее оставаться на managed-платформе, между 10 и 50 тысячами — имеет смысл гибридная схема, а выше 50 тысяч минут переход на LiveKit или Pipecat экономит 60–80% на стоимости минуты, но с этого момента вы сами отвечаете за латентность, телефонию и аптайм. Похожую границу называет и другой источник: Vapi дешевле на низких объёмах, потому что не берёт фиксированную ежемесячную плату, а LiveKit выигрывает примерно с 1 000 минут в месяц за счёт своего тарифа в $0.01 за минуту агента после базовых $50, что перебивает ставку Vapi в $0.05 за минуту хостинга.

Порог зависит от того, как вы считаете время инженера. Если у вас в команде уже есть человек, который умеет в Python и телефонию — self-host окупается раньше. Если такого человека нет, первые пару месяцев managed-платформа выйдет дешевле по факту, даже с более высоким тарифом за минуту.

Изображение

LiveKit или Vapi или Retell — что выбрать

Vapi — быстрый старт и лучшая интеграция с Twilio, Retell — жёстко зашитый workflow-билдер с сильной аналитикой звонков, LiveKit — полный контроль над стеком и данными для тех, кому это критично.

Vapi подходит большинству случаев: лучшая интеграция с Twilio, самый чистый developer experience, самый широкий выбор моделей и голосов. Retell стоит брать, если важнее самый проработанный конструктор workflow и плотно связанная аналитика звонков, а не гибкость в выборе моделей — например, подставить конкретную версию Claude или конкретный голос Cartesia в Retell сложнее, чем в Vapi.

КритерийVapiRetellLiveKit Agents
МодельManaged, закрытыйManaged, закрытыйOpen source, self-host
Цена за минуту$0.05–0.13, до $0.33 с BYOKFlat $0.07Раскладка по факту: STT+LLM+TTS+compute
Порог выгодностиДо ~10–20К мин/месДо ~10–20К мин/месОт ~10–20К мин/мес
Кастомизация стекаСредняяНиже, чем у VapiПолная
MCPЧерез интеграцииЧерез интеграцииНативно, 1.5.x
Кому подходитБыстрый запуск, агентствоОпинионированный workflow, аналитикаКонтроль, суверенность данных, масштаб

LiveKit стоит выбирать, если нужна HIPAA-совместимость, самостоятельно хостинг моделей, либо вы уже на масштабе, где важна стоимость минуты — а VAPI, если нужно запустить за дни, а не недели, и вы готовы работать с managed-инфраструктурой.

Изображение

С какими трудностями столкнётся вайбкодер без опыта в Python

Порог входа выше, чем у Vapi или Retell: нужен рабочий Python, понимание async-кода и телефонии, а не только промпт-инжиниринг.

Максим: «Мог просто засесть до пяти ночи и просто там править одну какую-то функцию, которая не работала. Если бы не терпение — в моменте я уже испотел, и мне хотелось просто всё это закрыть. Но я понимал, что это можно решить и нужно решить, чтобы идти дальше.»

С LiveKit это ровно та ситуация. Deepgram, LLM и Cartesia работают асинхронно и параллельно — если один из трёх потоков не синхронизирован, агент либо молчит, либо перебивает сам себя. Дебажить это сложнее, чем поправить промпт в UI Vapi. Зато когда всё встало на место — вы получаете стек, который целиком у вас: свой сервер, свои данные, своя цена за минуту без чужой наценки.

Изображение

FAQ

Что такое LiveKit Agents простыми словами?
Это open source фреймворк на Python и Node.js для создания голосовых и видео AI-агентов. Вы сами выбираете STT, LLM и TTS-провайдеров и разворачиваете либо на LiveKit Cloud, либо на своих серверах.

Нужно ли знать Python, чтобы начать?
Да, базовый уровень обязателен: async-функции, работа с переменными окружения, понимание того, как ставятся пакеты через pip. Без этого проще начать с Vapi или Retell.

Сколько стоит LiveKit Cloud?
Есть бесплатный тариф с базовым лимитом трафика, дальше — платные планы с оплатой по факту использования. Дополнительно оплачиваются подключённые STT, LLM и TTS у сторонних провайдеров.

Можно ли подключить Claude вместо GPT-4o mini?
Да, LLM-плагин меняется одной строкой. Выбор GPT-4o mini в базовом стеке — вопрос скорости и цены для диалогов в реальном времени, а не единственно верный вариант.

Работает ли MCP в LiveKit Agents с версии 1.5.x на реальных задачах?
Да, поддержка MCP нативная, без отдельной обвязки: агент подключается к MCP-серверу и получает доступ к его инструментам одной строкой конфигурации.

Чем адаптивные прерывания лучше обычного VAD?
Обычный VAD реагирует на любой звук — кашель, «угу», фоновый шум. Адаптивная модель различает, хочет ли человек реально перебить агента или просто издал случайный звук, и не обрывает реплику зря.

С какого объёма звонков имеет смысл переходить на self-hosted LiveKit?
Ориентир — 10 000–20 000 минут разговора в месяц. Ниже этого порога зарплата инженера на поддержку инфраструктуры съедает экономию на комиссии платформы.

Глоссарий

  • STT (Speech-to-Text) — распознавание речи, превращение голоса в текст.
  • TTS (Text-to-Speech) — синтез речи, превращение текста в аудио.
  • TTFA (Time To First Audio) — время до первого звука ответа, ключевая метрика для ощущения «живого» диалога.
  • MCP (Model Context Protocol) — протокол, через который агент подключается к внешним инструментам без отдельной интеграции под каждый из них.
  • Endpointing — момент, когда система понимает, что человек закончил говорить.
  • Adaptive interruption handling — модель, отличающая настоящее прерывание от случайного звука или короткой реплики-подтверждения.

Дальше по теме — сравнение Vapi, Retell и LiveKit, а если ищете готового AI-агента под свою профессию без написания кода — загляните в каталог агентов VibeCoderz. Если нужна помощь с выбором стека под конкретную задачу — запишитесь на консультацию к Максиму.

Обновлено: август 2026.

All Posts

Автор

Елисавета Наговицына
Елисавета Наговицына

Предприниматель · Контент-маркетолог · SEO-стратег · AI-продуктолог

2026/08/18

400 000+ органических переходов за 3 месяца. Со-основатель GoBanana (231K пользователей, 12+ млн ₽ без рекламы) и NeuroScribe (65K пользователей). SEO/GEO-стратегии для AI-поисковиков, 1 700+ единиц контента, 17+ реализованных стратегий.

Об авторе →

Читать далее

📢 Новость

Claude Code: новый CLI-агент от Anthropic

Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.

2026/02/27
📝 Конспект

Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов

Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.

2026/02/28
📝 Конспект

YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026

Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.

2026/02/28
📝 Конспект

Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода

Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.

2026/02/28
📝 Конспект

Vk Fast Cash Strategy

Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех

2026/02/28