Video Diffusion Models

Video Diffusion Models

使用扩散模型生成视频该项目展示扩散模型在视频生成中的应用,介绍面向视频数据的架构设计、图像与视频联合训练、文本条件生成,以及用于延长视频和提升分辨率的梯度条件方法。

Video Diffusion Models 页面快照
2
视频生成设置:无条件与条件生成
2
联合建模数据类型:图像与视频
3
页面介绍的基础技术:时空架构、联合训练与无分类器引导
研究内容

视频扩散生成的核心方法

从模型架构、训练方式和条件控制等方面了解视频扩散模型的实现思路与实验结果。

因子化时空 UNet

采用因子化空间—时间 UNet,将标准图像扩散模型中的二维 UNet 扩展到视频数据。

图像与视频联合训练

利用可处理不同序列长度的架构,同时进行图像建模和视频建模训练,以改善视频样本质量。

文本条件视频生成

展示根据文本条件生成视频的结果,并使用无分类器引导提升条件生成样本质量。

梯度条件方法

在采样过程中通过基于梯度的优化改善去噪数据的条件损失,增强生成样本与条件信息的一致性。

长视频与高分辨率扩展

将训练好的模型以基于帧块的自回归方式扩展到更长时间步和更高分辨率,并改善时间连贯性。

延伸阅读

论文与引用信息

通过官方页面提供的论文入口获取完整方法细节和更多实验结果。

Video Diffusion Models

从这里开始使用Video Diffusion Models。