产品简介
vllm LLM 是一个开源、快速易用的大语言模型推理和部署库,支持高吞吐量和高效内存管理,可降低成本,适合开发者、研究人员和企业构建 AI 应用。

核心功能
- 高吞吐量推理和部署
- PagedAttention 高效内存管理
- 支持多种量化和优化内核
- 流式输出和 OpenAI 兼容 API
- 分布式推理支持
快速开始
- 使用命令 `uv pip install vllm` 安装 vLLM
- 或从源码构建以进行开发
- 访问官方文档了解详细用法
界面预览
与其他方案对比
| 对比项 | vllm | 同类方案 |
|---|---|---|
| 推理吞吐量 | 高吞吐量,支持连续批处理 | 可能吞吐量较低,批处理效率不高 |
| 内存管理 | PagedAttention 高效内存管理,降低成本 | 内存管理不佳,资源消耗大 |
| 易用性 | 易集成,OpenAI 兼容 API,文档完善 | 集成复杂,API 不兼容 |
适合谁用
- 需要部署 LLM 服务的开发者
- 进行 LLM 研究和测试的研究人员
- 构建 AI 应用的企业用户
下载与版本
当前最新版本为 v0.25.1,发布于 2026-07-14。支持 Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/vllm-project/vllm