产品推荐 2026-07-23

vllm-mlx:本地运行高性能的本地大模型推理服务器

专为苹果芯片Mac优化的本地大模型推理服务器,兼容主流AI API。

开源软件Linux工具

产品简介

vllm-mlx 这是一个在苹果芯片Mac上本地运行大语言模型和视觉模型的高性能推理服务器。它兼容OpenAI和Anthropic的API标准,让开发者无需云端服务或模型转换,即可利用Mac的统一内存和Metal加速获得高速推理体验,适合需要本地、私有化部署AI能力的开发者和研究人员。

vllm-mlx 主界面

核心功能

  • 兼容OpenAI与Anthropic API
  • 支持多模态(文本、图像、视频、音频)
  • 原生MLX后端,400+ tok/s高性能
  • 连续批处理与KV缓存优化
  • 内置基准测试与监控指标

快速开始

  1. 通过pip安装:pip install vllm-mlx
  2. 启动服务:vllm-mlx serve [模型名] --port 8000
  3. 使用OpenAI或Anthropic SDK连接服务端口进行调用

界面预览

与其他方案对比

对比项vllm-mlx同类方案
部署环境与兼容性原生支持苹果芯片Mac,直接兼容OpenAI/Anthropic标准APIOllama等工具主要针对通用模型加载,API兼容性或针对性优化可能较弱
吞吐量与内存效率集成连续批处理、分页KV缓存、SSD级缓存,针对高并发优化基础本地推理工具可能缺乏这类面向生产环境的高级批处理和缓存优化

适合谁用

  • 使用苹果芯片Mac的AI开发者
  • 需要本地私有化部署大模型的研究人员
  • 希望以高兼容性方式测试多种开源模型的工程师

下载与版本

当前最新版本为 v0.4.0,发布于 2026-06-28。支持 Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/waybarrios/vllm-mlx