«Сбер» представил Time Adapter — надстройку к генеративным моделям для управления динамикой событий и частотой кадров

Команда ИИ‑проекта Kandinsky «Сбера» разработала решение под названием Time Adapter . Проект предоставляет собой надстройку к генеративным моделям, которая управляет динамикой событий и частотой кадров в ролике. По словам разработчиков, проект создан для решения распространённой проблемы видео‑генерации, когда ИИ‑модели хорошо передают картинку в отдельном кадре, но плохо понимают, как должно течь время в течение видеоролика. Исходный код Time Adapter опубликован под лицензией MIT, а научная статья о подходе по этому проекту была представлена на конференции по машинному обучению ICML. Модели генерации видео не всегда корректно передают скорость происходящего: быстрые действия могут неестественно растягиваться, а медленные — замирать или, наоборот, ускоряться. Например, падение шарика, которое в реальности занимает доли секунды, модель может растянуть на несколько секунд. Сгенерированные дождь или туман могут двигаться слишком медленно или рывками, а движения бегущего человека — выглядеть неестественно. Причина — в архитектуре моделей и в принципе обучения: приоритет традиционно отдаётся эстетике отдельного кадра, а не физической достоверности. В результате модель не умеет напрямую управлять динамикой событий и сцены, в сгенерированных роликах нарушается естественный темп происходящего. Time Adapter — компактный модуль (меньше 1% от размера основной модели), который подключается к готовой нейросети. Он состоит из двух независимых блоков: один управляет частотой кадров (от 15 до 60 FPS), другой — динамикой происходящего в каждый момент сцены.


Источник: Habr — https://habr.com/ru/news/1082410/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1082410

Комментарии