Сбер обновил свою генеративную ИИ-модель до версии Kandinsky 6.0 Video. Как сообщили Russian Business в пресс-службе компании, пользователи ГигаЧата получили возможность создавать видео с синхронным звуком. Нейросеть генерирует ролики с речью, музыкой и звуками окружения, а для создания видео достаточно описать сцену текстом или загрузить первый кадр и указать, какой звук должен сопровождать ролик.
Что умеет Kandinsky 6.0 Video
Ключевое отличие новой версии — одновременная обработка визуальной и звуковой составляющих ролика. Благодаря этому речь синхронизируется с движением губ, а звуки и музыка соответствуют происходящему в кадре. При необходимости пользователь может попросить модель создать видео без звука.
Нейросеть генерирует разные типы аудио: от диалогов и музыкального сопровождения до звуков шагов, ветра и проезжающего автомобиля. Звук создаётся с частотой 44 кГц — она используется большинством стриминговых сервисов.
Модель также научилась точнее передавать физику реального мира: движения людей, животных и техники стали естественнее, в том числе в динамичных сценах.
Ограничения и качество генерации
Максимальная продолжительность видео со звуком составляет пять секунд. В будущем компания планирует увеличить этот показатель.
В ГигаЧате доступны три варианта качества генерации:
- SD — для более быстрой генерации;
- HD — для более детализированного изображения;
- Full HD — для максимальной детализации ролика.
По данным Сбера, Kandinsky 6.0 Video Pro точнее предыдущей модели следует заданному сценарию и лучше передаёт движение камеры. Новая версия превосходит Kandinsky 5.0 в среднем в 71% случаев по совокупности критериев.
Доступ для разработчиков
Kandinsky 6.0 Video доступна разработчикам в открытом виде под лицензией MIT. Модель можно интегрировать в собственные продукты бесплатно.
Старший вице-президент Сбербанка, руководитель блока «Развитие генеративного ИИ» Антон Фролов заявил, что компания рассчитывает сделать генеративный ИИ инструментом для создания контента не только для профессионалов, но и для обычных пользователей.
«Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство», — заявил Антон Фролов.
Как обучали модель
Kandinsky 6.0 Video состоит из двух связанных модулей — для генерации видео и звука. Звуковой модуль обучали на более чем 20 млн видео со звуком. Для обучения отбирали ролики с чистой аудиодорожкой, а также видео с крупными планами говорящих людей, чтобы улучшить синхронизацию речи и мимики.
Что это значит
Обновление Kandinsky до версии 6.0 расширяет набор инструментов генерации контента, доступных пользователям ГигаЧата: теперь видео можно создавать со звуком и в Full HD без навыков монтажа. Открытая лицензия MIT позволяет разработчикам бесплатно встраивать модель в свои продукты. При этом сохраняются ограничения — максимальная длительность ролика со звуком составляет пять секунд, а компания лишь планирует увеличить этот показатель в будущем.

Комментарии · 0
Войдите, чтобы участвовать в обсуждении.