产品简介
vllm-mlx 这是一个在苹果芯片Mac上本地运行大语言模型和视觉模型的高性能推理服务器。它兼容OpenAI和Anthropic的API标准,让开发者无需云端服务或模型转换,即可利用Mac的统一内存和Metal加速获得高速推理体验,适合需要本地、私有化部署AI能力的开发者和研究人员。
核心功能
- 兼容OpenAI与Anthropic API
- 支持多模态(文本、图像、视频、音频)
- 原生MLX后端,400+ tok/s高性能
- 连续批处理与KV缓存优化
- 内置基准测试与监控指标
快速开始
- 通过pip安装:pip install vllm-mlx
- 启动服务:vllm-mlx serve [模型名] --port 8000
- 使用OpenAI或Anthropic SDK连接服务端口进行调用
界面预览
与其他方案对比
| 对比项 | vllm-mlx | 同类方案 |
|---|---|---|
| 部署环境与兼容性 | 原生支持苹果芯片Mac,直接兼容OpenAI/Anthropic标准API | Ollama等工具主要针对通用模型加载,API兼容性或针对性优化可能较弱 |
| 吞吐量与内存效率 | 集成连续批处理、分页KV缓存、SSD级缓存,针对高并发优化 | 基础本地推理工具可能缺乏这类面向生产环境的高级批处理和缓存优化 |
适合谁用
- 使用苹果芯片Mac的AI开发者
- 需要本地私有化部署大模型的研究人员
- 希望以高兼容性方式测试多种开源模型的工程师
下载与版本
当前最新版本为 v0.4.0,发布于 2026-06-28。支持 Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/waybarrios/vllm-mlx