ERID: Токен - 2VfnxwESjiU

Пользователи ГигаЧата теперь могут создавать видео со звуком

С нейросетью Сбера Kandinsky 6.0 Video любой может создавать видео со звуком – специальные навыки не нужны.

Пользователи ГигаЧата могут создавать видео с речью, музыкой и звуками окружения – в Full HD-качестве и полностью бесплатно. Это стало возможно благодаря новой модели Kandinsky 6.0 Video, которая генерирует ролики с синхронным звуком. Чтобы получить готовый ролик с озвучкой, достаточно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Максимальная длительность ролика со звуком – пять секунд, со временем разработчики планируют её увеличить. Кроме того, модель стала лучше передавать физику реального мира: движения людей, животных и техники в роликах выглядят естественнее и правдоподобнее. Kandinsky стал первой российской нейросетью, способной создавать видео с синхронным звуком.

Возможности модели

Kandinsky 6.0 Video – мультимодальная модель, которая одновременно "видит" и "слышит" то, что генерирует. Поэтому диалоги, эффекты и фоновая музыка синхронизированы с картинкой, а губы героя движутся вместе с речью. Если звук не нужен, можно попросить нейросеть создать видео без него. Когда модель не знает, как выглядит объект из запроса, например, новый персонаж поп-культуры, она ищет референсы и генерирует точный результат. Так можно создавать даже те объекты, которые появились уже после обучения модели.

Kandinsky создаёт натуральный звук в широком диапазоне: от разговора и цифровых эффектов до шагов, шума ветра или звука проезжающей машины. В одном ролике можно разыграть диалог, добавить музыку – от "испанской гитары" до "саундтрека к погоне", "лоу-фая для сонного вечера" или любой другой. Модель создает чистый и детализированный звук, без "шипения" и потери качества: в 44 кГц, стандартном качестве большинства стриминговых сервисов.

Эти возможности пригодятся для самых разных задач: с их помощью можно оживить семейную фотографию, записать видеооткрытку с речью или музыкой для близкого человека, снять ASMR-ролик с шелестом бумаги, потрескиванием дров или скрипом снега, или оживить старый мем или кадр из фильма.

Разработчикам новая модель доступна в опенсорсе под лицензией MIT – её можно бесплатно интегрировать в собственные продукты. Модель также будет доступна в популярных инструментах для запуска и интеграции нейросетей, например, FAL, Diffusers, FastVideo, ComfyUI, SGLang и vLLM-omni. Разработчикам не нужно писать интеграцию с нуля: Kandinsky 6.0 Video можно подключить прямо в существующий продукт.

Качество видео

Kandinsky 6.0 Video создаёт ролики в разрешении до Full HD. В ГигаЧате пользователи смогут выбрать нужное качество прямо в окне ввода перед отправкой запроса: SD для более быстрой генерации, HD или Full HD для более чёткой и детализированной картинки. Kandinsky 6.0 Video точнее передаёт физику реального мира. Движения людей, животных и предметов в роликах выглядят естественнее, а сцены целиком – правдоподобнее. Это особенно заметно в динамичных роликах с быстрым движением или сменой ракурса.

Обновление будет полезно всем, кто создаёт видео – в профессиональных и личных проектах:

  • Авторам контента для соцсетей: создать короткий ролик с озвученной репликой персонажа или фоновым звуком без микрофона, актёров и монтажа звука.
  • Малому бизнесу: сделать голосовой рекламный ролик о товаре или услуге без съёмочной группы.
  • Маркетологам и SMM-специалистам: собрать тестовый ролик с диалогом и фирменной атмосферой – звуком окружения и музыкальной подложкой – для соцсетей и мессенджеров.
  • Преподавателям: оживить архивное фото или портрет исторической личности с озвученной репликой – для урока истории или литературы.
  • Дизайнерам: собрать черновой ролик со звуком для питча или демонстрации идеи.

Реклама.
Рекламодатель: ПАО "Сбербанк"

Фото: ПАО Сбербанк