产品简介
Gen-L-Video 能扩展短视频扩散模型,生成数百帧的长视频并支持多文本语义段落控制,无需额外训练。适合视频创作者和研究人员高效制作长视频内容。

核心功能
- 支持生成数百帧长视频
- 多文本条件控制不同语义段落
- 无需额外训练,基于现有模型扩展
- 支持并行去噪提升效率
- 兼容多种视频控制方式如姿态、深度
快速开始
- 克隆GitHub仓库并安装Anaconda环境
- 安装Xformers、SAM和Grounding DINO依赖
- 下载预训练权重文件
- 运行命令如accelerate launch one-shot-tuning.py --control=pose生成视频
界面预览


与其他方案对比
| 对比项 | Gen-L-Video | 同类方案 |
|---|---|---|
| 长视频生成 | 支持生成数百帧长视频 | Tune-A-Video仅支持短视频 |
| 多文本条件 | 支持多文本语义段落控制 | LVDM仅支持单文本条件 |
| 训练需求 | 无需额外训练,基于现有模型扩展 | LVDM和NUWA-XL需要预训练 |
| 并行去噪 | 支持并行去噪,生成效率高 | 多数方法不支持并行处理 |
适合谁用
- 需要生成长视频的视频创作者
- 进行视频生成研究的学术人员
- 编辑视频多语义段落的内容编辑者
下载与版本
当前最新版本为 v0.2,发布于 2023-06-09。支持 Windows、macOS、Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/G-U-N/Gen-L-Video