产品简介
VideoReTalking 是一个开源系统,根据音频自动编辑说话头视频的唇部,生成高质量唇同步视频。它解决了手动编辑困难和情感不匹配问题,适合视频创作者和研究人员在野外场景使用。

核心功能
- 自动表情规范化处理
- 音频驱动唇同步生成
- 面部增强提高真实感
- 支持多种表情控制
- 无需手动对齐的自动化流水线
快速开始
- 克隆代码仓库并进入目录:git clone https://github.com/vinthony/video-retalking.git && cd video-retalking
- 创建Python 3.8环境并安装依赖:conda create -n video_retalking python=3.8 && conda activate video_retalking && pip install -r requirements.txt
- 下载预训练模型到 ./checkpoints 目录
- 运行推理命令:python3 inference.py --face <视频路径> --audio <音频路径> --outfile <输出路径>
界面预览

与其他方案对比
| 对比项 | 本工具 | 同类商业软件 | 在线服务 |
|---|---|---|---|
| 费用 | 开源免费 | 通常收费或含广告 | 可能有订阅或上传限制 |
| 隐私 | 本地运行,数据自持 | 依赖厂商政策 | 需上传数据到服务器 |
| 可定制性 | 源码开放,社区活跃 | 受限于官方功能 | 功能固定 |
适合谁用
- 需要制作唇同步说话视频的内容创作者
- 研究音频视频同步技术的学术人员
- 需要自动化编辑视频嘴部的编辑师
下载与版本
当前最新版本为 v0.0.1,发布于 2023-03-15。支持 多平台。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/OpenTalker/video-retalking