
Fish Audio
Синтез речи и клонирование голоса на моделях OpenAudio S1 и S2: 50+ языков, теги эмоций в квадратных скобках, мультиспикер и API со стримингом.

Обзор Fish Audio
Fish Audio — платформа синтеза речи (TTS) и клонирования голоса, разработчик открытых моделей OpenAudio S1 (июнь 2025, первое место на TTS-Arena2) и S2 (март 2026). S2 обучена на 10+ млн часов аудио примерно на 50 языках, поддерживает управление эмоциями через произвольные описания в квадратных скобках, мультиспикерные диалоги в одной генерации и стриминг с задержкой до первого звука около 100 мс. Клонирование голоса выполняется по образцу от 10–30 секунд без дообучения и переносится на все поддерживаемые языки. Бесплатный тариф даёт 8 000 кредитов в месяц (примерно 7 минут), платные планы начинаются с Plus за $20 в месяц и включают коммерческие права; API тарифицируется по $15 за миллион UTF-8-байт, из-за чего иероглифические языки обходятся втрое дороже латиницы. Сервис подходит контент-мейкерам, подкастерам, авторам аудиокниг и разработчикам голосовых интерфейсов. Пользователям из России удобнее работать через Speakmi — тот же движок, но с русским интерфейсом, оплатой картой РФ и без VPN.
Главные функции
Модель S2 с управлением подачей
Вставляйте описания прямо в текст — [whisper in small voice], [professional broadcast tone], [pitch up] — и модель отыграет нужную интонацию в этом месте фразы. Список выражений не ограничен фиксированным набором тегов.
Клонирование голоса по 10–30 секундам
Загрузите короткий образец — сервис перенесёт тембр, темп и манеру речи без дообучения модели. Клонированный голос работает на всех поддерживаемых языках.
Мультиспикерные диалоги
Реплики нескольких голосов размечаются тегами спикеров и синтезируются в одной генерации — удобно для подкастов, сценок и озвучки диалогов в играх.
50+ языков, включая русский
S2 обучена более чем на 10 млн часов аудио примерно на 50 языках: русский, английский, китайский, японский, корейский, испанский, немецкий, французский, арабский и другие.
Стриминговый API с задержкой ~100 мс
Dual-AR архитектура даёт время до первого звука порядка 100 мс, что позволяет строить голосовых ассистентов и интерактивные интерфейсы. Тарификация — $15 за миллион UTF-8-байт.
Открытые веса и код
Модели серии OpenAudio, код дообучения и движок инференса на SGLang выложены на GitHub и HuggingFace — сервис можно развернуть на своей инфраструктуре.
Библиотека готовых голосов
Сотни тысяч публичных голосовых моделей в каталоге сообщества с поиском и фильтрами — можно начать озвучку без собственной записи.
Плюсы и минусы
Преимущества
- Модель S2 (март 2026) с управлением подачей через произвольные описания в квадратных скобках, а не фиксированный список тегов.
- Клонирование голоса по образцу от 10–30 секунд без дообучения, с переносом на все поддерживаемые языки.
- Мультиспикерные диалоги в одной генерации.
- Открытые веса и код: модели доступны на GitHub и HuggingFace для self-hosted развёртывания.
- Стриминговый API с задержкой до первого звука около 100 мс.
- Бесплатный тариф на 8 000 кредитов в месяц для теста без оплаты.
Недостатки
- Из России сервис недоступен напрямую: нужны VPN и зарубежная карта — обходится через Speakmi на том же движке.
- API тарифицируется по UTF-8-байтам, поэтому китайский, японский и корейский текст стоит втрое дороже английского.
- Бесплатных 8 000 кредитов хватает примерно на 7 минут озвучки в месяц.
- Качество клона напрямую зависит от чистоты исходной записи: фоновый шум и музыка портят результат.
- Коммерческие права подключаются только на платных планах.
Для кого и как использовать?
Контент-мейкер (YouTube, Reels, подкасты)
Озвучивает ролики и выпуски собственным клонированным голосом, расставляя теги подачи в нужных местах сценария вместо перезаписи дублей.
Разработчик голосовых интерфейсов
Встраивает стриминговый API в ассистента, игру или чат-бота: задержка до первого звука порядка 100 мс позволяет вести диалог в реальном времени.
Автор аудиокниг и аудиоспектаклей
Собирает многоголосые сцены в одной генерации через теги спикеров, сохраняя единый тембр каждого персонажа по всей книге.
Маркетолог
Готовит рекламные аудио, IVR-меню и объявления на десятках языков, тестируя разные интонации без привлечения дикторов.
Специалист по локализации
Переносит клонированный голос диктора на другие языки, чтобы в локализованных версиях сохранялась узнаваемая подача.
Частые вопросы
Похожие нейросети и аналоги
Смотреть все
Vaani
Vaani клонирует ваш голос и переводит видео на 40+ языков с точной синхронизацией губ.

Goals from Loops
Loops — это платформа для рассылок, которая реально работает с продуктовыми метриками, а не просто считает открытия писем.

Fypro
Fypro — это ИИ-движок для создателей контента, который превращает подписчиков TikTok в реальных покупателей.

SUN
Создавай аудиоуроки на любую тему по запросу. Учись на ходу, пока едешь в метро или гуляешь.

Spira AI
Spira AI — это агент, который берет на себя создание контента и ведение соцсетей. Работает 24/7, следит за трендами и растит ваш бренд на автомате.

Pixero AI
Автономный ИИ-агент для запуска рекламы в Meta. Забирает ссылку на ваш сайт и через 9 минут выдает готовые кампании с креативами.