Для генерации видео пользователю достаточно описать сцену текстом, загрузить первый кадр и указать желаемое звуковое сопровождение. На текущем этапе нейросеть создаёт ролики со звуком продолжительностью до пяти секунд; в будущем планируется поддержка более длинных видео. Предусмотрена возможность выбора качества: SD, HD и Full HD.

