产品简介
mcp-bench MCP-Bench是一个用于评估大语言模型工具使用能力的基准测试框架。它基于MCP协议,通过复杂的真实世界任务,评估模型发现、选择和调用工具的能力。适合需要评估和对比不同大模型在工具使用场景下性能的开发者和研究人员。

核心功能
- 端到端评估流程,从工具发现到任务完成
- 多维度打分机制,综合评估任务完成度与规划能力
- 支持28个MCP服务器,覆盖多种工具场景
- 提供详细排行榜,可对比主流模型性能
- 支持Windows、macOS和Linux跨平台运行
快速开始
- 克隆仓库:`git clone https://github.com/accenture/mcp-bench.git`
- 安装依赖:使用conda创建环境并运行`install.sh`脚本
- 配置密钥:在`.env`文件中设置OpenRouter或Azure OpenAI的API密钥
- 运行测试:执行`python run_benchmark.py --models 模型名称`启动基准测试
界面预览
与其他方案对比
| 对比项 | mcp-bench | 同类方案 |
|---|---|---|
| 评估方式 | 通过MCP协议连接28个真实MCP服务器,执行复杂多工具协作任务 | 传统基准测试多基于静态问答或简化任务,难以反映真实工具调用能力 |
适合谁用
- 评估和选型大语言模型工具使用能力的AI开发者
- 研究大模型工具调用与规划能力的科研人员
- 需要在多工具复杂任务场景下测试模型的工程师
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/Accenture/mcp-bench