跳到正文
Lilian Weng|本人博客 RSS· Lilian Weng·收录时间:
图文

视频扩散的空间与时间分工:3D U-Net、DiT 与图像模型适配

Lilian Weng:视频扩散的时序一致性与架构综述

人工整理

人工整理|Lilian Weng 于2024-04-12发布的经典文字综述。文章把视频生成的额外难点归为跨帧一致性和视频数据供给,并梳理从头训练与扩展已有图像模型两条路线。3D U-Net可将空间卷积与时间注意力分开,DiT则以时空表示进行建模;另一条路径向图像模型加入时间层再微调。配图为原文署名研究架构图,不是观看影片。本批未运行模型或验证结果;文中2024技术脉络不当作当前排名,原页精确时间未知。

来源冻结;未取得模型评分,当前仅展示规则入口分;入口资料分8,仅按标题与原链信息完整性计算;尚未取得内容评分,不代表作品质量或材料不足。

评分依据

入口资料分8,仅按标题与原链信息完整性计算;尚未取得内容评分,不代表作品质量或材料不足。

来源:Lilian Weng|本人博客 RSS · lilianweng.github.io