产品简介
ai-vision-mcp 这是一款AI视觉能力扩展工具,旨在解决AI助手无法直接理解图片和视频内容的问题。它基于MCP协议,可将Google Gemini或Vertex AI模型的视觉分析能力无缝集成到Claude Desktop、Cursor等AI开发工具中,适合需要让AI分析视觉素材的技术用户和开发者。
核心功能
- 支持双AI模型供应商(Google Gemini与Vertex AI)
- 提供图像和视频的多模态内容分析
- 支持URL、本地文件、Base64等多种文件输入方式
- 跨平台支持(Windows/macOS/Linux)
- 包含完善的错误处理与重试机制
快速开始
- 选择模型服务(推荐Google AI Studio)并获取API密钥。
- 在AI客户端(如Claude Desktop)的配置文件中,按示例添加本MCP服务器的配置项及环境变量。
- 重启AI客户端,即可通过提供的MCP工具(如`analyze_image`)对图像或视频进行分析。
界面预览
与其他方案对比
| 对比项 | ai-vision-mcp | 同类方案 |
|---|---|---|
| 集成难度 | 遵循标准MCP协议,通过配置文件一键集成至主流AI客户端,开箱即用。 | 通常需要自行编写复杂的API调用代码和集成逻辑,对普通用户不友好。 |
| 分析能力 | 提供多种预设分析模式(如通用描述、提取设计色板、分析视觉层次),功能专注且深入。 | 一般仅为通用的图像描述或标签识别,缺乏面向特定场景的深度分析选项。 |
适合谁用
- 使用Claude、Cursor等AI编程工具的开发者,希望让AI具备视觉理解能力。
- 产品经理或设计师,需要借助AI快速分析UI截图或设计稿。
- 内容创作者或运营人员,希望自动化处理和理解图片、视频内容。
下载与版本
当前最新版本为 v0.0.7,发布于 2026-04-04。支持 Windows、macOS、Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/tan-yong-sheng/ai-vision-mcp