产品简介
sglang SGLang 是一个开源的高性能推理框架,专为大语言模型和多模态模型设计。它通过 RadixAttention、零开销调度等技术实现低延迟和高吞吐量推理,适用于从单 GPU 到大规模集群的部署。适合 AI 开发者、研究人员和企业团队优化模型服务性能。

核心功能
- RadixAttention 前缀缓存提升推理效率
- 支持张量并行、流水线并行等多种并行技术
- 结构化输出和多种量化格式支持(FP4/FP8/INT4等)
- 兼容 Hugging Face 模型和 OpenAI API
- 支持语言、嵌入、奖励和扩散等多种模型类型
快速开始
- 下载程序:点击页面上的「下载软件」按钮获取。
- 运行程序:解压或安装后运行主程序。
- 开始使用:打开 sglang,按界面提示操作。
界面预览

与其他方案对比
| 对比项 | sglang | 同类方案 |
|---|---|---|
| 推理性能 | 提供更高吞吐量和更低延迟,如比 vLLM 和 TensorRT-LLM 更快 | 同类框架如 vLLM、TensorRT-LLM 性能可能较低 |
适合谁用
- 需要部署大语言模型的 AI 开发者
- 进行模型推理性能优化的研究人员
- 构建企业级 AI 服务的技术团队
下载与版本
当前最新版本为 v0.5.15.post1,发布于 2026-07-14。支持 Windows、macOS、Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/sgl-project/sglang