Игорь Градов
Игорь Градов
5 мин
ai

Fish Audio привлекла $52 млн на AI синтез голоса: 8 млн пользователей и $21 млн выручки

Fish Audio, стартап из Пало-Альто, во вторник объявил о привлечении 52 миллионов долларов на посевном раунде, чтобы развивать модели синтеза голоса, которыми уже пользуются больше 8 миллионов человек.

Fish Audio привлекла $52 млн на AI синтез голоса: 8 млн пользователей и $21 млн выручки
Почему это важно

Посевной раунд в 52 миллиона долларов для компании с годовой выручкой в 21 миллион, это редкий сигнал: рынок AI голос синтез привлекает крупные ставки, а конкуренция за качество голоса выходит в фазу, где выигрывает тот, кто собрал живое сообщество голосовых доноров.

Раунд возглавили фонды Coreline Ventures и Capital Today. Также в нём участвовали 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners и HF0. По данным TechCrunch, компания зарабатывает 21 миллион долларов в год на подписках и корпоративных API, то есть модель уже приносит деньги, а не только обещания.

Параметр Значение
Компания Fish Audio (Пало-Альто, США)
Сумма 52 млн долларов
Тип сделки Посевной раунд (seed)
Лид-инвесторы Coreline Ventures, Capital Today
Годовая выручка 21 млн долларов

Как стартап одного GPU дорос до 8 миллионов пользователей?

Fish Audio начался как личный проект бывшего исследователя Nvidia Шицзя Ляо. Его раздражало, что синтетические голоса на рынке звучат неестественно. Он обучил модель генерации голоса на одном GPU и выложил её в открытый доступ.

Репозиторий Fish Speech на GitHub сейчас набрал больше 31 000 звёзд. Им пользуются инди-разработчики, геймдизайнеры и создатели контента.

За последний год компания выпустила пять моделей:

  • четыре для генерации речи (AI голос синтез),
  • одну для распознавания речи (speech-to-text, перевод звука в текст).

Три модели генерации речи остаются открытыми (опенсорс, то есть код доступен всем). Но новейшая S2.1 Pro работает только через платный API (интерфейс для программного подключения). Платформа предлагает больше 15 000 настроек на естественном языке для управления голосом.

Кто уже платит и зачем?

Fish Audio продаёт подписки для авторов и команд: фиксированное количество минут генерации плюс клонирование голоса. Для корпораций есть отдельный API.

Среди клиентов, по заявлению компании, HeyGen (платформа для видео с ИИ-аватарами) и Sanas (технологии голосовых агентов).

Каждое предприятие предъявляет свои требования. HeyGen хочет реализма в голосах для аватаров, игровая студия хочет выразительных голосов для персонажей, а компании вроде LiveKit хотят естественно звучащий голос с низкой задержкой для звонков. : Рисса Цао, CEO и сооснователь Fish Audio

Голоса пользователей: выгода и риск

Одна из причин роста библиотеки, сами пользователи. Компания предлагает загрузить свой голос для обучения моделей и получить компенсацию, если голос используется коммерчески. Это прямо касается русскоязычных авторов: платформа принимает голоса на разных языках, и создатели видео, игр или голосовых помощников из России могут участвовать.

Но несколько месяцев назад возникли проблемы: некоторые авторы заявили, что их голоса загрузили на платформу без их согласия. Процедура удаления через DMCA (механизм защиты авторских прав в США) существовала, но работала медленно.

По словам Рисса Цао, теперь процесс автоматизирован. Автор загружает короткий образец голоса или контракт, и голос удаляют с платформы за три минуты.

Честная оговорка: это не предотвращает первичную загрузку чужого голоса. Пока автор не узнает и не подаст заявку, его голос продолжает использоваться.

Подход, построенный на сообществе, работает только когда авторы доверяют платформе. Согласие, прозрачность и атрибуция должны быть встроены в продукт, а не добавлены задним числом. : Осукэ Хонда, партнёр Coreline Ventures

С кем конкурирует Fish Audio?

Рынок генерации речи плотный. По данным TechCrunch, среди конкурентов: ElevenLabs, WellSaid, Cartesia, Speechify, Async (ранее Podcastle) и Krisp. Все борются за бюджеты авторов и корпораций.

По мнению Рико Маллоцци, партнёра 359 Capital, преимущество Fish Audio в тонких настройках для разработчиков и экономичном обучении моделей. Он отметил, что компания достигла уровня качества сопоставимого с крупными лабораториями при значительно меньшей команде.

Компания планирует до конца года выпустить модель понимания аудио и модель прямого преобразования речи в речь (speech-to-speech).

Что это значит для вас?

Авторам Дзена и создателям видео. Fish Audio уже доступна для регистрации из России. Если вы озвучиваете ролики или хотите клонировать свой голос для серии видео, платформа предлагает подписку с фиксированным количеством минут. Три открытые модели можно запустить локально бесплатно, но для лучшего качества (S2.1 Pro) придётся платить за API.

Маркетологам. Конкуренция в AI голос синтез усиливается: ElevenLabs, WellSaid и Fish Audio давят друг на друга ценами и качеством. Это значит, что стоимость озвучки для рекламы и IVR (голосовые меню) будет снижаться.

Тем, кто хочет заработать голосом. Платформа компенсирует донорам голосов, чьи образцы используются коммерчески. Но перед загрузкой прочитайте условия: механизм защиты от несанкционированной загрузки пока реактивный, а не превентивный.

Мнение редакции dzen.guru

Меня больше всего зацепил не размер раунда, а модель «голос в обмен на компенсацию». По моим наблюдениям, ни один из российских сервисов синтеза речи пока не предлагает автору Дзена заработать на собственном голосе. Fish Audio это делает, но с оговоркой: пока нет верификации владельца голоса при загрузке, система работает на доверии. Я бы рекомендовал попробовать открытые модели Fish Speech локально, прежде чем платить за API. А если решите загрузить свой голос, сохраните образец и дату загрузки: это ваша страховка на случай спора.

52 миллиона на посевном раунде при 21 миллионе годовой выручки показывают, что инвесторы ставят не на технологию вообще, а на конкретный конвейер: открытая модель собирает сообщество, сообщество приносит голоса, голоса улучшают платный продукт. Для автора из России практический шаг прост: скачайте Fish Speech с GitHub, озвучьте один ролик и сравните с тем, что даёт Яндекс SpeechKit. Разница покажет, стоит ли переходить на платный тариф.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ИИ в рекрутинге оценил не кандидата, а интервьюера: практик разобрал свои ошибки
ai

ИИ в рекрутинге оценил не кандидата, а интервьюера: практик разобрал свои ошибки

Компания Potok (российский HR-tech-сервис) или конкретный стартап в тексте-источнике не упоминаются, раунда финансирования нет, суммы нет, инвестора нет.…

4 мин
Генератор видео на нейросети научился не терять деньги: чекпоинты спасают оплаченные сцены
ai

Генератор видео на нейросети научился не терять деньги: чекпоинты спасают оплаченные сцены

Немного терялся в размерах исходного текста, но продолжаю работу с ним. Оригинал обрывается, поэтому работаю строго по предоставленным фактам. Российский…

6 мин
Runlayer обвинила Rippling в краже MCP-шлюза: чем рискуют стартапы при пилотах с корпорациями
ai

Runlayer обвинила Rippling в краже MCP-шлюза: чем рискуют стартапы при пилотах с корпорациями

Стартап Runlayer, разработчик шлюза для протокола MCP (Model Context Protocol, стандарт, который позволяет ИИ-моделям и ИИ-агентам безопасно подключаться к…

5 мин