Что произошло
Стартап Fish Audio, специализирующийся на разработке ИИ-голосовых моделей, объявил о привлечении $52 млн в рамках seed-раунда. Раунд возглавили Coreline Ventures и Capital Today, также участие приняли 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners и HF0. Информация опубликована TechCrunch 28 июля 2026 года.
О компании
Fish Audio основан бывшим исследователем Nvidia Шицзя Ляо (Shijia Liao), который обучил первую модель генерации голоса на одном GPU и открыл её исходный код. Репозиторий Fish Speech на GitHub собрал более 31 000 звёзд и используется независимыми разработчиками, дизайнерами видеоигр и креаторами.
С момента запуска в прошлом году компания выпустила пять моделей: четыре для генерации речи и одну для распознавания речи. Три модели генерации речи доступны как open source, а последняя модель S2.1 Pro — только через платный API.
Продукты и клиенты
Fish Audio предлагает платные месячные тарифы для создателей и команд, включающие определённое количество минут генерации и функции клонирования голоса. Также есть корпоративная версия API и платформы, которую уже используют HeyGen и Sanas.
По словам генерального директора и сооснователя Риссы Цао (Rissa Cao), разные компании предъявляют разные требования к голосам: HeyGen нужны реалистичные голоса для ИИ-аватаров, игровым студиям — выразительные голоса персонажей, а голосовым агентам, таким как LiveKit, — естественные и низколатентные голоса для звонков.
Проблемы с согласием и их решение
Fish Audio строит библиотеку голосов, принимая от пользователей записи их голосов для обучения моделей и выплачивая компенсацию, если голос используется. Однако несколько месяцев назад некоторые создатели заявили, что их голоса были загружены без согласия. Компания имела процесс DMCA, но он занимал много времени.
Цао сообщила TechCrunch, что теперь процесс удаления автоматизирован: создатели могут отправить короткий образец голоса или контракт, подтверждающий право собственности, и голос будет удалён менее чем за три минуты. Однако это не предотвращает загрузку голоса артиста без его ведома, и до тех пор, пока артист не узнает об этом, голос продолжает использоваться.
Партнёр Coreline Ventures Оске Хонда (Osuke Honda) подчеркнул, что подход, основанный на сообществе, работает только при доверии создателей. Он считает, что индустрия должна двигаться к проверенному владению голосом, чётким условиям лицензирования, простым процессам подачи жалоб и удаления, а также к моделям распределения доходов.
Планы на будущее
Fish Audio планирует выпустить модель понимания аудио в этом году, а также разрабатывает модель «речь-в-речь» (speech-to-speech).
Рынок генерации речи конкурентный: аналогичные продукты есть у ElevenLabs, WellSaid, Cartesia, Speechify, Async (ранее Podcastle) и Krisp. Партнёр 359 Capital Рико Маллоцци (Rico Mallozzi) отметил, что тонкая настройка для разработчиков и экономичное обучение моделей помогут Fish Audio конкурировать с крупными ИИ-лабораториями.
Что это значит
Привлечение $52 млн на ранней стадии свидетельствует о высоком интересе инвесторов к ИИ-голосовым технологиям. Fish Audio уже демонстрирует значительную пользовательскую базу и выручку, что выделяет его среди многих стартапов. Однако проблемы с согласием и правами на голоса остаются серьёзным вызовом, и то, как компания решит эти вопросы, может повлиять на её долгосрочную репутацию и рост.

Комментарии · 0
Войдите, чтобы участвовать в обсуждении.