产品推荐 2026-07-24

ComfyUI_VLM_nodes:AI 模型集成工具(源码

ComfyUI 自定义节点集,集成视觉语言模型、大语言模型及音乐生成功能到工作流。

开源软件跨平台工具

产品简介

ComfyUI_VLM_nodes 这是一个 ComfyUI 的自定义节点集合,让用户在工作流中轻松使用视觉语言模型、大语言模型,并支持图像到音乐、文本到音乐转换及创意提示生成,解决 AI 模型集成复杂问题,适合 AI 艺术家、ComfyUI 用户和创意工作者。

ComfyUI_VLM_nodes 主界面

核心功能

  • 支持多种视觉语言模型(如 LLaVa、Qwen2-VL)
  • 提供结构化输出节点,可靠提取数据
  • 实现图像到音乐转换功能
  • 支持文本到音乐生成(通过 LLM)
  • 自动提示生成和建议节点

快速开始

  1. 在 ComfyUI 的 custom_nodes 目录中运行 `git clone https://github.com/gokayfem/ComfyUI_VLM_nodes.git`
  2. 下载所需 GGUF 格式模型文件(如从 HuggingFace 链接)
  3. 将模型文件放入 `models/LLavacheckpoints` 文件夹
  4. 启动 ComfyUI,使用新添加节点进行操作

界面预览

ComfyUI_VLM_nodes 界面截图

ComfyUI_VLM_nodes 界面截图

与其他方案对比

对比项ComfyUI_VLM_nodes同类方案
模型支持范围集成多种视觉语言模型和大语言模型,如 LLaVa、Qwen2-VL、InternLM 等可能只支持单一模型或需要额外配置
功能多样性除模型集成外,还支持图像到音乐、文本到音乐、提示生成等创意功能通常只专注于模型运行,缺乏创意功能扩展

适合谁用

  • 使用 ComfyUI 进行 AI 艺术创作的艺术家
  • 希望集成视觉语言模型到工作流中的开发者
  • 利用图像生成音乐的创意工作者

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项