Голосовой ассистент в 2026 году это уже не игрушка для колонки на кухне, а полноценный интерфейс: три нейросети слушают, понимают и отвечают вместо интерфейса с кнопками. Алиса, Google Ассистент и Салют от Сбера решают одну задачу по-разному, а собрать собственного голосового помощника сегодня можно за вечер на открытых инструментах, без штата разработчиков. Разберем, из каких частей состоит любой голосовой ассистент, чем отличаются три российских и мировых игрока, и как вайбкодеру собрать свою версию.
Голосовой ассистент ИИ работает по цепочке из трех нейросетей: распознавание речи, понимание смысла и синтез ответа. Алиса в 2026-м стала Алисой AI на YandexGPT, Google 4 сентября отключает классический Ассистент в пользу Gemini, а Салют Сбера работает на GigaChat. Свою версию собирают за вечер на связке Telegram, Whisper и ElevenLabs.
Как устроен голосовой ассистент внутри?
Голосовой ассистент это не одна нейросеть, а конвейер из четырех-пяти моделей, каждая отвечает за свой шаг: от звука к тексту, от текста к смыслу, от смысла обратно к речи.
Умная колонка слушает постоянно, если микрофон не выключен физически. Отдельная легкая нейросеть ждет только кодовое слово вроде «Алиса» или «Привет, Google» и не тратит ресурсы на остальной звук вокруг.
Когда кодовое слово прозвучало, включается основной конвейер. Сначала шумоподавление чистит звук от фонового гула. Потом STT-модель (Speech-to-Text) превращает голос в текст. Дальше NLU-блок (Natural Language Understanding) разбирает, что именно хочет пользователь, и передает запрос в сценарную платформу или в LLM. Ответ формируется текстом, а TTS-модель (Text-to-Speech) озвучивает его обратно.
Большинство плат в умных колонках крутится на Linux, а без интернета голосовой ассистент обычно работает в урезанном режиме: включит будильник, но не ответит на вопрос про погоду.

| Шаг конвейера | Что делает | Пример технологии |
|---|---|---|
| Wake word (KWS) | Ловит кодовое слово в фоне | Porcupine, openWakeWord |
| Шумоподавление | Чистит голос от шума | RNNoise и аналоги |
| STT | Речь -> текст | Whisper, YandexSpeechKit, SaluteSpeech |
| NLU / LLM | Текст -> смысл и ответ | YandexGPT, GigaChat, GPT-5.4 |
| TTS | Текст -> речь | ElevenLabs, SaluteSpeech, Google TTS |
Как работает голосовой помощник Алиса в 2026 году?
Алиса в октябре 2025 официально переросла в Алису AI на семействе YandexGPT с агентными функциями, а не просто отвечает голосом на команды.
По данным Mediascope, Алиса AI сейчас самый используемый ИИ-ассистент в России, у нее 14,3% пользователей, больше, чем у DeepSeek в стране. В профильном русскоязычном бенчмарке SLAVA флагманская модель Яндекса и YandexGPT 5.1 Pro занимают первые два места.
Голосом Алиса доступна в колонках, приложении и Браузере, а через API компания открывает доступ бизнесу отдельно от подписки. Бесплатная версия работает без лимитов для личных задач, а Алиса Pro с продвинутой моделью и длинным контекстом стоит около 169 рублей в месяц по данным на 2026 год. На мировом рынке модели Яндекса заметно отстают от лидеров, зато на разговорном русском и локальных реалиях работают увереннее многих зарубежных конкурентов.
Заменит ли Gemini голосовой ассистент Google?
С 4 сентября 2026 года Google начинает отключать классический Google Ассистент на Android, планшетах, Wear OS и в наушниках, оставляя вместо него Gemini.
Отключение растянется на несколько недель, после чего вернуть классический Ассистент станет невозможно. Исключение сделали только для автомобилей со встроенным Ассистентом, там он еще поработает. Для запуска Gemini устройству нужен минимум Android 9.0 и 2 ГБ оперативной памяти, а голосовая команда «Привет, Google» осталась прежней.
Изначально переход планировали закрыть еще в конце 2025 года, но график дважды сдвигали. Для пользователей из России ситуация отдельная: Gemini без обхода региональных ограничений может быть недоступен, а по колонкам и телевизорам компания пока не дала внятных разъяснений. Тем, кто держит умный дом на голосовых командах, стоит проверить свои устройства на совместимость уже сейчас, переходный период идет прямо в момент публикации этой статьи.

Как устроен голосовой помощник Салют от Сбера?
Салют объединяет несколько ассистентов Сбера (в колонках SberBoom, приложении и партнерских устройствах) и с 2026 года работает на модели GigaChat вместо более простых сценарных ответов.
Линейка GigaChat к маю 2026 года включает три модели: GigaChat-2 Lite на 8 млрд параметров для массовых диалогов, GigaChat-2 Pro на 70 млрд для сложного контента и GigaChat-2 Max с контекстом до 128 тысяч токенов для глубоких рассуждений. За голос отдельно отвечает SaluteSpeech, доступная через единый API вместе с текстовыми моделями.

Физлицам GigaChat-2 Lite достается бесплатно, миллион токенов в месяц, а дальше подключается платный тариф PERS Plus. На колонках SberBoom пользователь может продиктовать запрос и получить голосовой ответ, сгенерированный GigaChat прямо в диалоге, без переключения в приложение.
Алиса, Google или Салют что выбрать для своих задач?
Для русскоязычного бытового сценария Алиса и Салют закрывают задачу без обхода блокировок, Gemini через Google сильнее в мультимодальности, но требует доступности сервиса в регионе.
| Критерий | Алиса AI | Google / Gemini | Салют (GigaChat) |
|---|---|---|---|
| Доступность в РФ | Полная | Ограничена | Полная |
| Основа | YandexGPT 5.1 Pro | Gemini | GigaChat-2 |
| Сила | Русский язык, контекст быта | Мультимодальность, экосистема | Интеграция со Сбер-сервисами |
| Голосовой синтез | Собственный SpeechKit | Google TTS | SaluteSpeech |
| Для бизнеса | API Yandex Cloud | Gemini API (ограничено) | GigaChat API, закрытый контур |
Если нужно просто перевести деньги голосом или включить свет в квартире, Алиса или Салют закроют задачу без танцев с VPN. Если нужна работа с фото и видео через голос, Gemini формально мощнее, но для России это пока история с оговорками.

Из чего собрать голосового ассистента ИИ самому?
Собственный голосовой ассистент строится на том же конвейере STT → LLM → TTS, но каждый блок вайбкодер выбирает и настраивает сам, без привязки к одной экосистеме.
Для распознавания речи открытая модель Whisper от OpenAI работает локально бесплатно, а облачный OpenAI Whisper API берет деньги за минуту аудио. Это удобно, когда нужна точность без своего сервера. Для активации по кодовому слову подойдет легкая модель вроде WK или openWakeWord: она не грузит систему постоянным прослушиванием через тяжелую нейросеть.
За озвучку отвечает ElevenLabs: бесплатный тариф дает около 10 минут аудио в месяц, тариф Starter дает уже порядка получаса за 5 долларов, а Creator за 22 доллара открывает клонирование голоса и качество для коммерческого использования. Для мозгов связки годится любая LLM через OpenRouter: от Claude Sonnet 4.6 до GigaChat, в зависимости от бюджета и языка.

| Роль в стеке | Бесплатный вариант | Платный вариант |
|---|---|---|
| Wake word | openWakeWord | Porcupine Pro |
| STT | Whisper локально | OpenAI Whisper API |
| LLM | GigaChat-2 Lite | Claude Sonnet 4.6 через OpenRouter |
| TTS | ElevenLabs Free (10 мин) | ElevenLabs Starter/Creator |
| Оркестрация | n8n self-hosted | n8n Cloud |
Как собрать голосового ассистента за вечер на Telegram и нейросетях?
Рабочая связка выглядит просто: Telegram-бот принимает голосовое сообщение, ElevenLabs транскрибирует и озвучивает, AI-агент в n8n обрабатывает текст, и все возвращается пользователю тем же голосовым сообщением.
Схема выглядит так: пользователь отправляет голосовое в Telegram → бот скачивает аудиофайл → ElevenLabs превращает звук в текст → AI Agent обрабатывает запрос по заданному System Message → ElevenLabs озвучивает ответ выбранным голосом → бот присылает аудио обратно. Вся цепочка собирается визуально в n8n без единой строчки кода.
Для Telegram-бота нужен токен, а для ElevenLabs нужен API-ключ с разрешениями на text-to-speech, speech-to-text и speech-to-speech (галочку «restrict» лучше не ставить, иначе часть функций отвалится). System Message в AI Agent задает характер ассистента: строгий консультант, дружелюбный помощник по задачам или голосовой копирайтер, который надиктованные мысли превращает в готовый пост. Подключенная память (Memory) удерживает контекст разговора, а векторная база знаний (Tool) позволяет ассистенту отвечать по конкретным документам компании, а не только общими фразами.
Лиза: «Голосом сказала: напомни мне послезавтра в 13:00 записаться к врачу, и бот сам прислал напоминание за час до приема. Собрала всю связку примерно за полчаса, чисто для себя, без единой строчки кода.»
Такой ассистент годится для онлайн-продаж в мессенджере, поддержки клиентов в режиме 24/7, личного помощника руководителя или онбординга новых сотрудников по базе знаний компании. Для готового шаблона под конкретную профессию проще заглянуть в каталог агентов VibeCoderz: там уже 297 ниш под разные задачи бизнеса.

Можно ли написать голосового помощника на Python без опыта?
Да, но полностью локальная модель распознавания на слабом железе часто ошибается, поэтому разработчики комбинируют легкую wake-word модель с облачным Whisper для самой команды.
Пример из практики: голосовой помощник для запуска треков в Spotify по фразе «включи Металлику Enter Sandman». Легкая WK-модель постоянно слушает только кодовое слово, а как только оно сработало, аудио с командой уходит в OpenAI Whisper API на транскрибацию. Это дешевле, чем гонять облачный API непрерывно на каждый звук в комнате.
Дальше код ищет активные устройства через Spotify API, выбирает нужное и запускает воспроизведение. Основная проблема тут в точном соответствии имен переменных окружения в .env файле и в самом коде: без этого API просто не подключится. Для сборки временных аудиофайлов пригодится модуль tempfile, а для чтения переменных окружения пригодится python-dotenv.
Зачем вайбкодеру голосовой ввод в Claude Code?
Голосовой режим в Claude Code позволяет диктовать промпты прямо во время кодинга: команда /voice включает режим, а зажатый пробел активирует запись по принципу push-to-talk.

Текст ложится точно в позицию курсора, поэтому можно печатать часть промпта руками, а часть договорить голосом, не переключаясь между приложениями и не копируя текст из сторонних инструментов транскрибации. Разработчики сравнивают это с Whisper Flow, только без отдельной подписки и без разрыва рабочего процесса.
Сценарий удобен для длинных детализированных промптов: объяснить архитектуру, продиктовать «перенеси эту функцию в отдельный файл» или «добавь обработку ошибки для случая, когда API возвращает 429», не отрываясь от потока мысли. Токены за голосовую транскрипцию не входят в общий лимит использования Claude Code, а вот в Agent SDK голосовой режим пока не появился: там ставка на программные интерфейсы, а не на живой диалог. Подробнее об инструменте читайте на странице Claude Code в каталоге VibeCoderz.
Что получится, а что нет, если собрать голосового ассистента самому?
Самодельный ассистент выигрывает в гибкости и цене за минуту диалога, но проигрывает Алисе и Салюту в стабильности инфраструктуры и мгновенной реакции без задержек.
Сильная сторона в полном контроле над характером ассистента через System Message и в возможности подключить собственную базу знаний вместо чужого универсального сценария. Экономика тоже честная: часть распознавания уходит на бесплатную локальную модель, а платится только за облачные вызовы там, где это действительно нужно.
Слабое место в обслуживании. Готовая Алиса или Салют работает на инфраструктуре, которая не падает от перегрузки сервера, а самодельная связка на n8n может подвиснуть, если провайдер API ответит с задержкой. Плюс придется самому следить за ключами, лимитами и обновлениями моделей. Это не разовая настройка, а текущая работа, пусть и небольшая.

Частые вопросы про голосовой ассистент ИИ
Чем голосовой ассистент отличается от обычного чат-бота? Голосовой ассистент добавляет два дополнительных шага: распознавание речи на входе и синтез речи на выходе. Логика ответа внутри может быть той же LLM, что и в текстовом чат-боте.
Можно ли пользоваться Google Ассистентом в России после отключения в сентябре 2026? Классический Ассистент отключают поэтапно с 4 сентября, а полноценный доступ к Gemini в России ограничен без дополнительных настроек. Для быта проще смотреть в сторону Алисы или Салюта.
Сколько стоит собрать своего голосового ассистента с нуля? Стартовый вариант на бесплатных лимитах Whisper и ElevenLabs Free обойдется в ноль рублей, платить придется только при росте нагрузки: от 5 долларов за расширенный тариф озвучки.
Нужно ли знать Python, чтобы собрать голосового помощника? Нет, связку на n8n собирают визуально без кода. Python пригодится только для более гибких сценариев вроде управления сторонним API типа Spotify.
Работает ли голосовой ассистент без интернета? Частично. Локальная wake-word модель и офлайн-версия Whisper справятся с простыми командами, а для полноценного диалога с LLM нужен интернет.
Чем Алиса AI отличается от прежней YandexGPT? Это по сути ребрендинг: с октября 2025 YandexGPT в потребительских продуктах называется Алисой AI и получила больше агентных функций поверх прежней языковой модели.
Какой голосовой ассистент лучше подходит для бизнеса в России? Для клиентского сервиса на русском языке чаще выбирают Алису или GigaChat через API: оба доступны без обхода блокировок и понимают локальный контекст лучше зарубежных решений.
Глоссарий голосового ассистента
- STT (Speech-to-Text) это модель, которая превращает звук речи в текст.
- TTS (Text-to-Speech) это модель, которая озвучивает текст голосом.
- NLU (Natural Language Understanding) это блок, который извлекает смысл и намерение из текста запроса.
- Wake word / KWS это кодовое слово и модель, которая его распознает, не тратя ресурсы на остальной звук.
- LLM (Large Language Model) это большая языковая модель, которая формирует содержательный ответ.
- n8n это визуальный конструктор автоматизаций для сборки связок из нейросетей и сервисов без кода.
Что дальше
Голосовой ассистент ИИ в 2026 году перестал быть привилегией больших компаний: конвейер STT → LLM → TTS собирается за вечер на открытых сервисах и обходится в разумные деньги. Прежде чем выбирать инструменты под задачу, загляните в каталог AI-инструментов VibeCoderz: там собраны актуальные обзоры и цены на инструменты для вайбкодинга. А если нужен разбор именно вашего сценария, запишитесь на консультацию к Максиму — он показывает, какая связка окупится быстрее для конкретного бизнеса.
Обновлено: сентябрь 2026.