因子化时空 UNet
采用因子化空间—时间 UNet,将标准图像扩散模型中的二维 UNet 扩展到视频数据。
使用扩散模型生成视频该项目展示扩散模型在视频生成中的应用,介绍面向视频数据的架构设计、图像与视频联合训练、文本条件生成,以及用于延长视频和提升分辨率的梯度条件方法。
从模型架构、训练方式和条件控制等方面了解视频扩散模型的实现思路与实验结果。
采用因子化空间—时间 UNet,将标准图像扩散模型中的二维 UNet 扩展到视频数据。
利用可处理不同序列长度的架构,同时进行图像建模和视频建模训练,以改善视频样本质量。
展示根据文本条件生成视频的结果,并使用无分类器引导提升条件生成样本质量。
在采样过程中通过基于梯度的优化改善去噪数据的条件损失,增强生成样本与条件信息的一致性。
将训练好的模型以基于帧块的自回归方式扩展到更长时间步和更高分辨率,并改善时间连贯性。
通过官方页面提供的论文入口获取完整方法细节和更多实验结果。