Qwen3-TTS 本地运行:安装、声音克隆与硬件实测
2026/10/05

Qwen3-TTS 本地运行:安装、声音克隆与硬件实测

区分 Qwen3-TTS Base、CustomVoice 和 VoiceDesign,了解官方安装、Mac 量化后端实测、参考音准备与离线使用。

Qwen3-TTS 已提供可下载的本地语音模型。 参考录音克隆用 Base,内置说话人用 CustomVoice,文字描述新音色用 VoiceDesign。它们是不同权重,不能把一个文件当成三种功能通用。本篇分别说明官方安装路径与 Local AI Audio 使用的量化路径。

资料核验于 2026 年 10 月 5 日;下面的性能数字来自 9 月 23 日历史测试,不是对所有当前安装包的新测试。Qwen-Audio-3.1 是另一个系列,参见云端 API 与本地 Qwen3-TTS 对比。

先选模型和运行方式

需求对应模型 / 路径先检查什么
用内置音色朗读官方 CustomVoice支持的说话人与语言
用参考录音克隆官方 0.6B / 1.7B Base干净的单人录音与准确文字
用文字设计音色官方 1.7B VoiceDesign需要单独下载
在桌面软件中使用Local AI Audio 的 0.6B Base Q8,audio.cpp 后端当前安装版本的模型列表

官方仓库提供 Python 路径;0.6B Base 模型卡列出较小的克隆模型与 Apache-2.0 许可。权重不等于完整运行环境,还需要后端要求的 tokenizer 和依赖。

官方本地安装

下面对应官方 NVIDIA 示例,请先准备兼容 CUDA 的 PyTorch;上游建议使用独立的 Python 3.12 环境:

conda create -n qwen3-tts python=3.12 -y
conda activate qwen3-tts
python -m pip install -U qwen-tts
qwen-tts-demo --help
qwen-tts-demo Qwen/Qwen3-TTS-12Hz-1.7B-Base --ip 127.0.0.1 --port 8000

在同一台电脑打开 http://127.0.0.1:8000。首次运行会下载模型。上传参考录音,填写录音里准确的文字,再填写需要朗读的新句子;如果要使用内置音色,换成 CustomVoice 权重。

这套 CUDA 示例不是 Mac 安装命令。FlashAttention 有自己的显卡与精度要求,不要直接照搬到 Apple Silicon。保持后端依赖版本一致;下载完所有资源后断网再跑一次,确认工作流真的不依赖网络。

Mac 和 Windows 桌面路径

Local AI Audio是 TopLocal Studio 的语音模块。当前模型目录选择的是 Qwen3-TTS 0.6B Base Q8 GGUF + audio.cpp,不是上面官方 1.7B Python 示例。目录标注模型下载约 2 GB;这是磁盘占用,不是运行内存。

  1. 打开语音模块,确认当前版本提供 Qwen3-TTS。
  2. 查看许可并下载模型。
  3. 添加清晰的单人录音及其准确文字。
  4. 先生成一句,听漏字、数字与中英文发音,再逐步加长。
  5. 保存到本地;需要离线使用时再断网验证。

Mac 版本面向 Apple Silicon;Windows 使用打包后端,不能拿 CUDA 命令替代。本文没有测试当前 Windows 安装包,获取前请看平台与安装说明。

Mac 历史实测

下载本次引用的历史测量摘要 CSV。这是 9 月 23 日记录的摘录,不是新测试。

2026 年 9 月 23 日,MacBook Pro M5 Pro、64 GB 统一内存,audio.cpp 487800f5,0.6B Q8 GGUF;分别测试 Metal 和 CPU。

项目记录结果
Metal 生成速度音频播放速度的 2.6–3.4 倍
CPU 生成速度约 1 倍
记录内存占用3.1–3.6 GB
英文 / 中英混说的转写回测错误率所选短句中均为 0.0%
中文 / 粤语回测错误率所选短句中为 1.9% / 4.2%

这是单台机器的小样本。评分方法是让 Qwen3-ASR-1.7B 把生成声音转回文字,因此不代表音色相似度,也不保证不会读错。参考音来自项目样例,并非为本文新录。不能用这些数字推出所有 Mac、NVIDIA 显卡或长文本的最低内存。

其中一条输入是:今天的 meeting 改到下午三点,请把最新的 PPT 发到我的 email,谢谢。试听时除了自然度,也要检查英文单词是否完整。

已有声音克隆示例

以下是产品已有演示,与上表的性能测试不是同一组素材,用于展示参考录音到新内容的流程。

参考文字:很久很久以前,在一片安静的森林里,住着一只爱看星星的小狐狸。每天晚上,它都会爬上山坡,数着天上的星星慢慢睡去。

新文字:这是用刚才那段录音克隆出来的声音,我可以用它朗读任何新的内容,比如这句话。

常见问题怎么排查

  • **找不到克隆选项:**检查是否加载 Base,而不是 CustomVoice 或 VoiceDesign。
  • **漏字或发音不对:**缩短句子,按预期写出数字,核对参考文字;音色相似不能弥补错误输入。
  • **内存不足:**减小批量和文本长度,关闭其他模型,再考虑小模型或后端支持的量化;改扩展名不会把权重变成 GGUF。
  • **浏览器无法录音:**先上传保存好的音频文件;麦克风权限与浏览器、HTTPS 设置有关。
  • **断网仍报错:**检查 tokenizer、模型或其他资源是否尚未缓存;本地网页界面本身不能证明推理离线。

请用自己的声音或获得授权的参考音。离线声音克隆指南补充录音建议;录音转文字应使用离线转录,不应选 TTS 模型。云端产品与本地软件的取舍见离线 ElevenLabs 替代方案。

邮件列表

加入我们的社区

订阅邮件列表,及时获取最新消息和更新