
Qwen3-TTS 本地运行:安装、声音克隆与硬件实测
区分 Qwen3-TTS Base、CustomVoice 和 VoiceDesign,了解官方安装、Mac 量化后端实测、参考音准备与离线使用。
Qwen3-TTS 已提供可下载的本地语音模型。 参考录音克隆用 Base,内置说话人用 CustomVoice,文字描述新音色用 VoiceDesign。它们是不同权重,不能把一个文件当成三种功能通用。本篇分别说明官方安装路径与 Local AI Audio 使用的量化路径。
资料核验于 2026 年 10 月 5 日;下面的性能数字来自 9 月 23 日历史测试,不是对所有当前安装包的新测试。Qwen-Audio-3.1 是另一个系列,参见云端 API 与本地 Qwen3-TTS 对比。
先选模型和运行方式
| 需求 | 对应模型 / 路径 | 先检查什么 |
|---|---|---|
| 用内置音色朗读 | 官方 CustomVoice | 支持的说话人与语言 |
| 用参考录音克隆 | 官方 0.6B / 1.7B Base | 干净的单人录音与准确文字 |
| 用文字设计音色 | 官方 1.7B VoiceDesign | 需要单独下载 |
| 在桌面软件中使用 | Local AI Audio 的 0.6B Base Q8,audio.cpp 后端 | 当前安装版本的模型列表 |
官方仓库提供 Python 路径;0.6B Base 模型卡列出较小的克隆模型与 Apache-2.0 许可。权重不等于完整运行环境,还需要后端要求的 tokenizer 和依赖。
官方本地安装
下面对应官方 NVIDIA 示例,请先准备兼容 CUDA 的 PyTorch;上游建议使用独立的 Python 3.12 环境:
conda create -n qwen3-tts python=3.12 -y
conda activate qwen3-tts
python -m pip install -U qwen-tts
qwen-tts-demo --help
qwen-tts-demo Qwen/Qwen3-TTS-12Hz-1.7B-Base --ip 127.0.0.1 --port 8000在同一台电脑打开 http://127.0.0.1:8000。首次运行会下载模型。上传参考录音,填写录音里准确的文字,再填写需要朗读的新句子;如果要使用内置音色,换成 CustomVoice 权重。
这套 CUDA 示例不是 Mac 安装命令。FlashAttention 有自己的显卡与精度要求,不要直接照搬到 Apple Silicon。保持后端依赖版本一致;下载完所有资源后断网再跑一次,确认工作流真的不依赖网络。
Mac 和 Windows 桌面路径
Local AI Audio是 TopLocal Studio 的语音模块。当前模型目录选择的是 Qwen3-TTS 0.6B Base Q8 GGUF + audio.cpp,不是上面官方 1.7B Python 示例。目录标注模型下载约 2 GB;这是磁盘占用,不是运行内存。
- 打开语音模块,确认当前版本提供 Qwen3-TTS。
- 查看许可并下载模型。
- 添加清晰的单人录音及其准确文字。
- 先生成一句,听漏字、数字与中英文发音,再逐步加长。
- 保存到本地;需要离线使用时再断网验证。
Mac 版本面向 Apple Silicon;Windows 使用打包后端,不能拿 CUDA 命令替代。本文没有测试当前 Windows 安装包,获取前请看平台与安装说明。
Mac 历史实测
下载本次引用的历史测量摘要 CSV。这是 9 月 23 日记录的摘录,不是新测试。
2026 年 9 月 23 日,MacBook Pro M5 Pro、64 GB 统一内存,audio.cpp 487800f5,0.6B Q8 GGUF;分别测试 Metal 和 CPU。
| 项目 | 记录结果 |
|---|---|
| Metal 生成速度 | 音频播放速度的 2.6–3.4 倍 |
| CPU 生成速度 | 约 1 倍 |
| 记录内存占用 | 3.1–3.6 GB |
| 英文 / 中英混说的转写回测错误率 | 所选短句中均为 0.0% |
| 中文 / 粤语回测错误率 | 所选短句中为 1.9% / 4.2% |
这是单台机器的小样本。评分方法是让 Qwen3-ASR-1.7B 把生成声音转回文字,因此不代表音色相似度,也不保证不会读错。参考音来自项目样例,并非为本文新录。不能用这些数字推出所有 Mac、NVIDIA 显卡或长文本的最低内存。
其中一条输入是:今天的 meeting 改到下午三点,请把最新的 PPT 发到我的 email,谢谢。试听时除了自然度,也要检查英文单词是否完整。
已有声音克隆示例
以下是产品已有演示,与上表的性能测试不是同一组素材,用于展示参考录音到新内容的流程。
参考文字:很久很久以前,在一片安静的森林里,住着一只爱看星星的小狐狸。每天晚上,它都会爬上山坡,数着天上的星星慢慢睡去。
新文字:这是用刚才那段录音克隆出来的声音,我可以用它朗读任何新的内容,比如这句话。
常见问题怎么排查
- **找不到克隆选项:**检查是否加载 Base,而不是 CustomVoice 或 VoiceDesign。
- **漏字或发音不对:**缩短句子,按预期写出数字,核对参考文字;音色相似不能弥补错误输入。
- **内存不足:**减小批量和文本长度,关闭其他模型,再考虑小模型或后端支持的量化;改扩展名不会把权重变成 GGUF。
- **浏览器无法录音:**先上传保存好的音频文件;麦克风权限与浏览器、HTTPS 设置有关。
- **断网仍报错:**检查 tokenizer、模型或其他资源是否尚未缓存;本地网页界面本身不能证明推理离线。
请用自己的声音或获得授权的参考音。离线声音克隆指南补充录音建议;录音转文字应使用离线转录,不应选 TTS 模型。云端产品与本地软件的取舍见离线 ElevenLabs 替代方案。
更多文章

MacWhisper、Superwhisper 替代软件:把音频和视频文件转成文字
MacWhisper 是转写文件的,Superwhisper 主要是语音输入。讲清两者的区别,再介绍一款在 Mac 和 Windows 上离线把录音、视频转成文字和 SRT 字幕的替代方案。

2026 年开源 TTS 模型怎么选:Kokoro、F5-TTS、XTTS v2、Chatterbox 等十款对比
2026 年主流开源文字转语音模型一览:Kokoro、F5-TTS、XTTS v2、Chatterbox、Piper、Orpheus、VibeVoice、Fish Speech、IndexTTS2、CosyVoice。许可证、声音克隆、语言和本地运行方式。

GPT-SoVITS 详解:训练专属音色和零样本克隆有什么区别
GPT-SoVITS 是什么,零样本模式(5 秒)和少样本训练(约 1 分钟)的区别,WebUI 训练流程,v2 到 v4、v2Pro 各版本怎么选,硬件要求,以及更省事的替代方案。
邮件列表
加入我们的社区
订阅邮件列表,及时获取最新消息和更新