Журналист TechCrunch Доминик-Мадори Дэвис получила от стартапа Synthesia собственный интерактивный цифровой аватар — цифрового двойника, который может отвечать на вопросы. Об этом она рассказала в материале, опубликованном TechCrunch. По её словам, это первый случай, когда Synthesia сделала цифровой аватар для журналиста — и вообще для кого-либо за пределами сотрудника компании Александру Войки.
Поводом стало приглашение в новый офис Synthesia в Нью-Йорке. Компания, изначально основанная в Великобритании, предлагает корпоративным клиентам создавать интерактивные обучающие видео с ИИ-аватарами. Как отмечает TechCrunch, в этом году Synthesia достигла оценки в $4 млрд, а годом ранее сообщила о преодолении отметки в $100 млн ARR.
Что именно сделала Synthesia
По данным TechCrunch, компания выпускает три типа продуктов:
- платформу для создания и распространения видео с классическими аватарами, где человек вводит сценарий, а аватар его повторяет;
- агентную платформу Sessions, позволяющую взаимодействовать с аватарами в опросах или ролевых сценариях;
- API-платформу, где видео- и голосовые модели Synthesia можно комбинировать с другими сервисами для создания интерактивных аватаров и иных продуктов.
Ранее компания также запустила продукт Roleplay Sessions — он даёт сотрудникам возможность отрабатывать, например, презентации продаж с интерактивным ИИ-аватаром, который отвечает и оценивает их ответы.
Как создавался цифровой двойник
Для создания аватара журналист пришла в мини-студию внутри офиса Synthesia: там сделали множество её фотографий и записали двухминутный образец голоса. Она дала согласие на создание аватаров. В итоге ей сделали персональный аватар — тот, что просто читает заданный сценарий, — в двух вариантах, с очками и без, а также два интерактивных аватара, способных слушать и отвечать, тоже с очками и без.
Интерактивный аватар обучили на одном конкретном материале — истории о том, почему стартапы с венчурным финансированием чаще совершают мошенничество, чем компании без такого финансирования. Аватар отвечает только на вопросы по этой теме.
По описанию TechCrunch, стек интерактивного аватара объединяет модели распознавания речи в текст, видео, языковые модели и синтез речи. Голосовые и видео-модели — собственные разработки Synthesia, но компания также позволяет клиентам выбирать альтернативы от других лабораторий, включая Cartesia, ElevenLabs, Google и OpenAI. Предприятия могут размещать аватары в любом облаке или платить Synthesia за хостинг.
Схема работы такая: модель «речь в текст» превращает сказанное в текст, агентная языковая модель осмысляет его и может предпринимать действия, модель «текст в речь» озвучивает ответ, а видео-модель Synthesia анимирует аватар во время разговора. На создание аватаров у команды ушло несколько дней.
Впечатления от теста
Персональный аватар, по словам журналистки, звучал довольно точно — и, к её радости, не передал хрипотцу, которая была при записи образца. Нетехнические знакомые нашли это одновременно интересным и жутковатым.
Интерактивная версия оказалась детерминированной: на вопросы не по теме — например, где автор работала до TechCrunch или в какой части Нью-Йорка жила, — аватар каждый раз возвращался к материалу о венчурном мошенничестве. Знакомые сочли, что голос не очень похож на оригинал, а сходство слабее, чем у персонального аватара, но всё равно достаточно близкое, чтобы быть немного жутким. Мать журналистки назвала результат «удивительным» и пошутила: «Не помню, чтобы я рожала двоих таких».
Размышления о будущем журналистики
Опыт заставил автора задуматься, каким может быть будущее журналистики. Готовы ли люди к тому, что новости будет вести аватар? Один инвестор, по её словам, сразу ответил «нет». При этом она отмечает сильное сопротивление «ИИ-мусору», распространившемуся в соцсетях и на новостных платформах, но другие собеседники не были так уверены. Возникает вопрос: смогут ли аватары дополнить или даже заменить журналистов и захотят ли руководители общаться с ИИ-аватаром журналиста вместо живого человека.
Сама автор подчёркивает: главное в журналистике — доверие, и его, по её мнению, нельзя передать ИИ. Вне журналистики идея клонирования себя, по её оценке, может быть привлекательной: версия человека всегда на месте и отвечает на вопросы, пока он отдыхает.
При этом после первого восторга от новизны журналистка испытала смешанные чувства. Она внимательно разглядывала аватар после того, как тот замолчал, и ждала — сама не зная чего: возможно, что он моргнёт, скажет что-то новое, улыбнётся или даст понять, что осознаёт происходящее. Детерминированные двойники этого не сделают никогда. Но, по её мнению, легко представить, как человек может впасть в подобие «ИИ-психоза» при взаимодействии с недетерминированным аватаром, которым управляет чат-бот, свободный рассуждать на любые темы.
Автор также замечает, что её поколение, Gen Z, вероятно, не привыкнет к цифровым двойникам: они ощущаются как научная фантастика. Впрочем, аватары она находит менее пугающими, чем гуманоидов, — хотя бы потому, что при странностях всегда можно выйти из системы.
Что это значит
Кейс показывает, что интерактивные аватары выходят за пределы корпоративного обучения и ролевых тренингов, для которых их продвигает Synthesia, и начинают применяться в медиасреде. При этом опыт TechCrunch демонстрирует и ограничения технологии: детерминированный аватар отвечает только в рамках заданной темы, а вопрос доверия к журналистике остаётся открытым. Насколько широко аватары приживутся в корпоративной и медийной практике, по мнению автора материала, покажет время.

Комментарии · 0
Войдите, чтобы участвовать в обсуждении.