产品简介
VLM-AutoYOLO 是一个开源 AI 自动标注和 YOLO 训练平台,支持图像视频自动标注、手动精修和一键训练 YOLO 模型。它利用 VLM 和 SAM 技术简化目标检测数据准备和模型训练流程,适合需要快速开发 AI 视觉应用的开发者和研究人员。

核心功能
- 基于 VLM 的开放词汇自动标注
- SAM2/SAM3 像素级分割精修
- 智能视频关键帧提取与 SSIM 去重
- 一键 YOLOv8/v11/v26 模型训练
- 多格式数据集导入导出(YOLO/COCO/VOC)
快速开始
- 克隆仓库并进入目录
- 运行 python3 cli.py all 一键部署
- 打开浏览器访问 http://localhost:5173 开始使用
界面预览


与其他方案对比
| 对比项 | VLM-AutoYOLO | 同类方案 |
|---|---|---|
| 自动标注技术 | 使用 VLM 开放词汇自动标注,支持自然语言描述 | 传统手动标注或基于规则的自动标注 |
| 训练流程 | 一键训练多种 YOLO 版本,实时进度监控 | 需手动配置参数和命令行训练 |
| 视频处理 | 智能关键帧提取与去重,支持视频输入 | 通常需预先处理视频为图像序列 |
适合谁用
- 需要快速标注图像数据的 AI 研究人员
- 希望简化 YOLO 训练流程的目标检测开发者
- 处理视频内容提取关键帧的分析人员
下载与版本
当前最新版本为 v1.5.13,发布于 2026-06-29。支持 Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/Somnusochi/VLM-AutoYOLO