产品简介
py-xiaozhi 是轻量级跨平台多模态AI交互框架,支持实时语音流、视觉任务和IoT设备控制,解决大型语言模型与硬件连接的难题,适合开发者构建个性化语音助手应用。

核心功能
- 实时语音AI,延迟低于20ms
- 多模态视觉,集成摄像头和图像理解
- MCP模块化工具生态系统,支持音乐播放、截图等
- 跨平台部署,兼容Windows、macOS、Linux和ARM设备
- 离线唤醒词识别,基于Sherpa-ONNX
快速开始
- 下载程序:点击页面上的「下载软件」按钮获取。
- 运行程序:解压或安装后运行主程序。
- 开始使用:打开 py-xiaozhi,按界面提示操作。
界面预览
与其他方案对比
| 对比项 | 本工具 | 同类商业软件 | 在线服务 |
|---|---|---|---|
| 费用 | 开源免费 | 通常收费或含广告 | 可能有订阅或上传限制 |
| 隐私 | 本地运行,数据自持 | 依赖厂商政策 | 需上传数据到服务器 |
| 可定制性 | 源码开放,社区活跃 | 受限于官方功能 | 功能固定 |
适合谁用
- 需要开发跨平台AI语音助手的程序员
- 集成物联网设备控制的智能家居用户
- 实验多模态AI交互的研究人员
下载与版本
当前最新版本为 v2.0.8,发布于 2026-07-18。支持 Windows、macOS、Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/huangjunsen0406/py-xiaozhi