产品简介
gemini-skill 这是一个开源工具,通过浏览器自动化技术控制Gemini网页版,实现AI图片生成、文本对话和图片管理。适合开发者集成到AI工作流,以及需要批量生成内容的用户。
核心功能
- AI生图:自动生成高清图片,支持原图下载
- 文本对话:与Gemini进行多轮对话
- 图片上传:上传参考图基于参考生成新图
- 图片提取:提取会话中的图片,支持base64和完整尺寸下载
- 会话管理:新建会话、切换模型和导航历史会话
快速开始
- 克隆仓库:git clone https://github.com/WJZ-P/gemini-skill.git
- 进入目录并安装依赖:cd gemini-skill && npm install
- 配置环境变量或.env文件,如设置浏览器路径
- 启动工具并通过MCP客户端调用,确保浏览器已登录Google账号
界面预览


与其他方案对比
| 对比项 | gemini-skill | 同类方案 |
|---|---|---|
| 集成协议 | 支持标准MCP协议,可被Claude等客户端调用 | 可能需要自定义API或仅限特定平台 |
| 云运行支持 | 提供Atlas Cloud Provider和Bloome云上运行选项 | 通常需自建环境手动部署 |
适合谁用
- 需要自动化生成AI图片的设计师或创作者
- 希望将Gemini集成到MCP客户端的开发者
- 使用AI工具进行批量内容生产的团队
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/WJZ-P/gemini-skill