产品简介
ComfyUI_VLM_nodes 这是一个 ComfyUI 的自定义节点集合,让用户在工作流中轻松使用视觉语言模型、大语言模型,并支持图像到音乐、文本到音乐转换及创意提示生成,解决 AI 模型集成复杂问题,适合 AI 艺术家、ComfyUI 用户和创意工作者。

核心功能
- 支持多种视觉语言模型(如 LLaVa、Qwen2-VL)
- 提供结构化输出节点,可靠提取数据
- 实现图像到音乐转换功能
- 支持文本到音乐生成(通过 LLM)
- 自动提示生成和建议节点
快速开始
- 在 ComfyUI 的 custom_nodes 目录中运行 `git clone https://github.com/gokayfem/ComfyUI_VLM_nodes.git`
- 下载所需 GGUF 格式模型文件(如从 HuggingFace 链接)
- 将模型文件放入 `models/LLavacheckpoints` 文件夹
- 启动 ComfyUI,使用新添加节点进行操作
界面预览


与其他方案对比
| 对比项 | ComfyUI_VLM_nodes | 同类方案 |
|---|---|---|
| 模型支持范围 | 集成多种视觉语言模型和大语言模型,如 LLaVa、Qwen2-VL、InternLM 等 | 可能只支持单一模型或需要额外配置 |
| 功能多样性 | 除模型集成外,还支持图像到音乐、文本到音乐、提示生成等创意功能 | 通常只专注于模型运行,缺乏创意功能扩展 |
适合谁用
- 使用 ComfyUI 进行 AI 艺术创作的艺术家
- 希望集成视觉语言模型到工作流中的开发者
- 利用图像生成音乐的创意工作者
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/gokayfem/ComfyUI_VLM_nodes