VibeCoderzVibeCoderz
Fish Audio icon

Fish Audio

Синтез речи ИИ
Текст в речь
Клонирование голоса ИИ

Синтез речи и клонирование голоса на моделях OpenAudio S1 и S2: 50+ языков, теги эмоций в квадратных скобках, мультиспикер и API со стримингом.

Перейти на сайт
Fish Audio screenshot

Обзор Fish Audio

Fish Audio — платформа синтеза речи (TTS) и клонирования голоса, разработчик открытых моделей OpenAudio S1 (июнь 2025, первое место на TTS-Arena2) и S2 (март 2026). S2 обучена на 10+ млн часов аудио примерно на 50 языках, поддерживает управление эмоциями через произвольные описания в квадратных скобках, мультиспикерные диалоги в одной генерации и стриминг с задержкой до первого звука около 100 мс. Клонирование голоса выполняется по образцу от 10–30 секунд без дообучения и переносится на все поддерживаемые языки. Бесплатный тариф даёт 8 000 кредитов в месяц (примерно 7 минут), платные планы начинаются с Plus за $20 в месяц и включают коммерческие права; API тарифицируется по $15 за миллион UTF-8-байт, из-за чего иероглифические языки обходятся втрое дороже латиницы. Сервис подходит контент-мейкерам, подкастерам, авторам аудиокниг и разработчикам голосовых интерфейсов. Пользователям из России удобнее работать через Speakmi — тот же движок, но с русским интерфейсом, оплатой картой РФ и без VPN.

Главные функции

Модель S2 с управлением подачей

Вставляйте описания прямо в текст — [whisper in small voice], [professional broadcast tone], [pitch up] — и модель отыграет нужную интонацию в этом месте фразы. Список выражений не ограничен фиксированным набором тегов.

Клонирование голоса по 10–30 секундам

Загрузите короткий образец — сервис перенесёт тембр, темп и манеру речи без дообучения модели. Клонированный голос работает на всех поддерживаемых языках.

Мультиспикерные диалоги

Реплики нескольких голосов размечаются тегами спикеров и синтезируются в одной генерации — удобно для подкастов, сценок и озвучки диалогов в играх.

50+ языков, включая русский

S2 обучена более чем на 10 млн часов аудио примерно на 50 языках: русский, английский, китайский, японский, корейский, испанский, немецкий, французский, арабский и другие.

Стриминговый API с задержкой ~100 мс

Dual-AR архитектура даёт время до первого звука порядка 100 мс, что позволяет строить голосовых ассистентов и интерактивные интерфейсы. Тарификация — $15 за миллион UTF-8-байт.

Открытые веса и код

Модели серии OpenAudio, код дообучения и движок инференса на SGLang выложены на GitHub и HuggingFace — сервис можно развернуть на своей инфраструктуре.

Библиотека готовых голосов

Сотни тысяч публичных голосовых моделей в каталоге сообщества с поиском и фильтрами — можно начать озвучку без собственной записи.

Плюсы и минусы

Преимущества

  • Модель S2 (март 2026) с управлением подачей через произвольные описания в квадратных скобках, а не фиксированный список тегов.
  • Клонирование голоса по образцу от 10–30 секунд без дообучения, с переносом на все поддерживаемые языки.
  • Мультиспикерные диалоги в одной генерации.
  • Открытые веса и код: модели доступны на GitHub и HuggingFace для self-hosted развёртывания.
  • Стриминговый API с задержкой до первого звука около 100 мс.
  • Бесплатный тариф на 8 000 кредитов в месяц для теста без оплаты.

Недостатки

  • Из России сервис недоступен напрямую: нужны VPN и зарубежная карта — обходится через Speakmi на том же движке.
  • API тарифицируется по UTF-8-байтам, поэтому китайский, японский и корейский текст стоит втрое дороже английского.
  • Бесплатных 8 000 кредитов хватает примерно на 7 минут озвучки в месяц.
  • Качество клона напрямую зависит от чистоты исходной записи: фоновый шум и музыка портят результат.
  • Коммерческие права подключаются только на платных планах.

Для кого и как использовать?

Контент-мейкер (YouTube, Reels, подкасты)

Озвучивает ролики и выпуски собственным клонированным голосом, расставляя теги подачи в нужных местах сценария вместо перезаписи дублей.

Разработчик голосовых интерфейсов

Встраивает стриминговый API в ассистента, игру или чат-бота: задержка до первого звука порядка 100 мс позволяет вести диалог в реальном времени.

Автор аудиокниг и аудиоспектаклей

Собирает многоголосые сцены в одной генерации через теги спикеров, сохраняя единый тембр каждого персонажа по всей книге.

Маркетолог

Готовит рекламные аудио, IVR-меню и объявления на десятках языков, тестируя разные интонации без привлечения дикторов.

Специалист по локализации

Переносит клонированный голос диктора на другие языки, чтобы в локализованных версиях сохранялась узнаваемая подача.

Частые вопросы

Похожие нейросети и аналоги

Смотреть все