
Voicebox 本地部署实测:支持 GPU 加速、CPU 备用、多个 TTS / Whisper / LLM 模型,一台普通 Windows 主机也能搭自己的声音工作室。
最近我折腾了一个很有意思的开源项目:Voicebox。
它不是单纯的文字转语音工具,而更像一个“本地 AI 声音工作室”:可以克隆声音、生成配音、用 Whisper 做语音转文字,还能用本地小语言模型处理文本。重点是:声音样本、生成内容、模型缓存都可以放在自己的电脑里。
这点对经常做视频配音、播客草稿、文章朗读、AI 角色声音、离线语音工具的人来说,很香。
我这次是在 Windows 上部署,机器是 NVIDIA RTX 3060 Ti 8GB。CPU 不算强,所以路线很明确:能走 CUDA 就优先走 GPU,同时保留 CPU 启动方式兜底。
Voicebox 能做什么?
简单说,它把几类常用声音能力放在了一个界面里:
- 文字转语音:把文章、脚本、旁白生成语音
- 声音克隆:上传一小段参考音频,创建自己的声音档案
- 预设声音:不想克隆时,可以直接用内置声线
- 语音转文字:集成 Whisper 模型做转写
- 多模型切换:同一段文字可以换不同引擎试效果
- 本地运行:模型和数据尽量留在自己的电脑上

新手先看结论:推荐这样用
如果你是第一次部署,不建议一上来把所有模型都装满。
我实测下来,新手最舒服的路线是:
1. 先启动 GPU 模式 2. 先用 Qwen TTS 0.6B / 1.7B 做中文配音 3. 想要更广语言覆盖,再试 Chatterbox 4. 想要轻量快速,就用 Kokoro 5. Whisper 转写按需选 base / small / medium 6. TADA 最后再装,因为它有额外大依赖
我本地测试结果:
| 类型 | 已通过模型 | |—|—| | TTS 生成 | Qwen TTS 0.6B / 1.7B、Qwen CustomVoice 0.6B / 1.7B、LuxTTS、Chatterbox、Chatterbox Turbo、Kokoro | | 语音转文字 | Whisper base / small / medium / large / turbo | | 本地 LLM | Qwen3 0.6B / 1.7B / 4B | | 暂不建议新手先折腾 | TADA 1B / TADA 3B,因为 HumeAI/tada-codec 额外依赖很大 |
这次完整实测是 16/18 个模型通过。剩下 2 个 TADA 不是主模型没下好,而是它还有一套隐藏的 codec / aligner 依赖,体积大、下载慢,新手可以先跳过。

我的部署思路:尽量不污染系统
这类 AI 项目最烦的地方不是“难”,而是容易把系统 Python、缓存目录、环境变量弄得一团糟。
所以我这次部署时采用了隔离策略:
- 项目放在:
C:GJvoicebox - Python 虚拟环境放在:
C:GJvoicebox.venv - 模型缓存放在:
C:GJvoicebox.localmodels - 临时文件放在:
C:GJvoicebox.localtmp - 下载文件放在:
C:GJvoicebox.localmanual-downloads - GPU / CPU 启动脚本分开
这样做的好处是:不轻易改系统全局配置,不影响别的 AI 项目,后续如果不要了,也比较容易整体清理。
一键启动方式
部署好以后,日常使用不需要再敲一堆命令。
项目根目录里有两个启动入口:
<code class="language-bat">start-voicebox-gpu.bat</code>
这一行的意思:
- 双击它会启动 GPU / CUDA 模式
- 适合 NVIDIA 显卡用户
- 我这台 RTX 3060 Ti 实测可用
<code class="language-bat">start-voicebox-cpu.bat</code>
这一行的意思:
- 双击它会启动 CPU 模式
- 适合显卡不可用、CUDA 出问题、或者只想轻量测试的时候
- 速度会慢一些,但可以作为兜底路线
关闭服务用:
<code class="language-bat">stop-voicebox.bat</code>
这一行的意思:
- 停止 Voicebox 后端和前端服务
- 释放本地端口和显存
- 不想让模型常驻后台时就双击它
启动成功后,浏览器打开:
<code class="language-text">http://127.0.0.1:5173/</code>
这一行的意思:
127.0.0.1表示只在本机访问5173是前端页面端口- 不暴露到局域网,更适合个人本地使用

第一次创建声音:参考音频别太长
新手最容易踩的坑之一:参考音频太长。
Voicebox 创建克隆声音时,参考音频建议控制在 30 秒以内。我之前上传过较长音频,页面直接提示:
<code class="language-text">Invalid reference audio: Audio too long (maximum 30.0 seconds)</code>
这一行的意思:
- 参考音频超过 30 秒
- 不是模型坏了
- 剪短音频后重新上传即可
推荐参考音频:
- 10 到 20 秒
- 背景噪音少
- 只有一个人说话
- 语速自然
- 最好和参考文本完全对应
中文配音推荐:先用 Qwen TTS
如果主要做中文配音,我建议新手先从 Qwen TTS 开始。
我本地实测:
| 模型 | 结果 | 适合用途 | |—|—|—| | Qwen TTS 0.6B | 通过 | 快速试音、短句测试、轻量配音 | | Qwen TTS 1.7B | 通过 | 更稳定的正式中文配音 | | Qwen CustomVoice 0.6B | 通过 | 不上传参考音频,直接用预设声线 | | Qwen CustomVoice 1.7B | 通过 | 预设声线 + 更好质量 |
我的建议:
- 试效果:先用 0.6B
- 正式导出:再用 1.7B
- 不想折腾克隆声音:用 CustomVoice 的预设男声/女声
Chatterbox:适合更丰富的声音表现
Chatterbox 多语言版和 Chatterbox Turbo 也都跑通了。
我的感受是:
- Chatterbox 多语言:更适合多语言、克隆声音
- Chatterbox Turbo:更适合英文和带情绪标签的表达
比如 Chatterbox Turbo 支持类似这样的情绪标签:
<code class="language-text">[laugh] That was unexpected.</code>
这一行的意思:
[laugh]表示笑声或带笑的表达- 后面的英文会按 Chatterbox Turbo 的方式生成
- 这类标签不建议直接丢给所有模型,因为有些模型会把标签念出来
Kokoro:小而快,适合轻量场景
Kokoro 是这次体验里很适合新手的轻量模型。
它的特点:
- 模型小
- 加载快
- 预设声音多
- 对电脑压力小
如果你只是想快速生成一段英文、测试工作流、或者电脑显存不大,Kokoro 很适合作为入门模型。
Whisper:本地转写也能用
这次 Whisper 五个模型都测试通过:
| Whisper 模型 | 实测结果 | 新手建议 | |—|—|—| | base | 通过 | 最轻量,适合快速试 | | small | 通过 | 速度和效果比较平衡 | | medium | 通过 | 中文转写更稳一些 | | large | 通过 | 更大,更吃资源 | | turbo | 通过 | 速度不错,适合常用 |
如果你只是做中文短音频转写,我建议先试:
1. small 2. medium 3. turbo
本地 Qwen3 LLM:能跑,但 4B 已经贴近 8GB 显存上限
Voicebox 里还集成了本地 Qwen3 LLM,用来做文本处理、润色、角色化表达等。
我这台 8GB 显卡实测:
| 模型 | 结果 | 备注 | |—|—|—| | Qwen3 0.6B | 通过 | 推荐日常轻量使用 | | Qwen3 1.7B | 通过 | 更稳一点 | | Qwen3 4B | 通过 | 能跑,但显存压力接近上限 |
4B 虽然通过了,但显存最高接近 7.7GB。我的建议是:除非你确实需要更强文本能力,否则日常用 0.6B 或 1.7B 更舒服。
TADA 为什么先不推荐新手折腾?
TADA 本身不是不能用,而是它额外依赖比较大。
主模型下载完以后,它还会需要:
<code class="language-text">HumeAI/tada-codec</code>
这一行的意思:
- 这是 TADA 的额外 codec / aligner 依赖
- 不完全等同于页面上显示的 TADA 主模型
- 如果缺这个,可能会出现
IncompleteRead、Connection broken一类错误
我这边已经补齐了 TADA 的核心英文/中文依赖:
<code class="language-powershell">..venvScriptspython.exe .toolsverify_tada_codec.py --core</code>
这行命令的意思:
- 用项目本地 Python 运行校验脚本
- 只检查 TADA 英文/中文常用核心文件
- 当前核心文件校验结果是
13/13完整
如果想补齐全量 TADA 依赖,可以继续断点下载:
<code class="language-powershell">..venvScriptspython.exe -u .toolsdownload_tada_codec_resume.py --endpoint https://hf-mirror.com --all</code>
这行命令的意思:
- 用项目本地 Python 运行断点下载脚本
-u表示实时输出进度,方便观察--endpoint https://hf-mirror.com表示使用 Hugging Face 镜像--all表示补齐所有语言 aligner
但新手真的可以先不碰 TADA。先把 Qwen、Chatterbox、Kokoro、Whisper 跑顺,体验会好很多。

常见坑:Failed to fetch 是什么?
如果页面弹出:
<code class="language-text">Failed to fetch</code>
这一行的意思通常是:
- 前端页面访问不到后端
- 后端服务没启动
- 端口不对
- 浏览器请求地址没有代理到本地后端
排查顺序:
1. 先确认是否启动了 start-voicebox-gpu.bat 2. 再打开 http://127.0.0.1:5173/ 3. 如果还不行,先执行 stop-voicebox.bat 4. 然后重新启动 GPU 或 CPU 模式
配图建议:
- 截 Failed to fetch 红色弹窗
- 截启动成功后的健康页面或主页
常见坑:模型显示已下载,但生成还是报错
这个坑我也踩了。
有些模型页面显示已下载,只代表主模型文件存在;但真正运行时可能还会加载额外依赖。
典型例子就是 TADA:
<code class="language-text">Connection broken: IncompleteRead(...)</code>
这一行的意思:
- 后端正在下载某个大依赖
- 网络中途断了
- 文件没完整落盘
- 不是你的文字输入问题
解决思路:
- 用断点下载脚本补完整文件
- 用
verify_tada_codec.py校验大小 - 不要只看网页上的 downloaded 状态
常见坑:模型切换后卡住
多个大模型来回切换时,显存可能不会马上完全释放。
我做了一个优化:生成前尽量卸载其它 TTS 模型,减少模型互相占显存的问题。
如果你手动使用时感觉卡住,可以按这个顺序处理:
1. 点页面里的取消或等待当前任务失败 2. 双击 stop-voicebox.bat 3. 等 5 到 10 秒 4. 再双击 start-voicebox-gpu.bat

我的实测模型报告
本地实测报告摘要如下:
| 模型 | 类型 | 结果 | |—|—|—| | qwen-tts-0.6B | TTS | 通过 | | qwen-tts-1.7B | TTS | 通过 | | qwen-custom-voice-0.6B | TTS | 通过 | | qwen-custom-voice-1.7B | TTS | 通过 | | luxtts | TTS | 通过 | | chatterbox-tts | TTS | 通过 | | chatterbox-turbo | TTS | 通过 | | kokoro | TTS | 通过 | | whisper-base | STT | 通过 | | whisper-small | STT | 通过 | | whisper-medium | STT | 通过 | | whisper-large | STT | 通过 | | whisper-turbo | STT | 通过 | | qwen3-0.6b | LLM | 通过 | | qwen3-1.7b | LLM | 通过 | | qwen3-4b | LLM | 通过 | | tada-1b | TTS | 暂跳过,额外依赖未全量补齐 | | tada-3b-ml | TTS | 暂跳过,额外依赖未全量补齐 |
这个结果对新手来说已经够用了:日常配音、克隆声音、转写、轻量文本处理都可以先跑起来。
适合谁?
我觉得 Voicebox 特别适合这几类人:
- 做短视频配音的人
- 想把文章批量转成音频的人
- 想尝试本地声音克隆的人
- 不想把声音样本上传到云端的人
- 喜欢折腾开源 AI 工具的人
- 需要本地 Whisper 转写的人
如果你追求“打开网页立刻用”,云服务更省心。 如果你更在意本地控制、隐私、可玩性和长期成本,那 Voicebox 很值得折腾。
新手部署建议
我的建议不是“全都装”,而是分阶段:
第一阶段:跑通界面
- 启动 GPU 模式
- 打开本地网页
- 上传 10 到 20 秒参考音频
- 用 Qwen TTS 0.6B 生成一句话
第二阶段:稳定常用模型
- Qwen TTS 1.7B
- Qwen CustomVoice
- Chatterbox
- Kokoro
- Whisper small / medium
第三阶段:再补大模型
- Whisper large
- Qwen3 4B
- TADA 全量依赖
这样部署体验会轻松很多,不会一开始就被十几个 GB 的模型下载劝退。
结尾
这次折腾下来,我最大的感受是:
本地 AI 声音工具已经越来越像“可用的软件”,而不只是开发者玩具了。
Voicebox 还不是那种完全无脑的一键工具,尤其 Windows + Hugging Face 大模型下载这块,偶尔会有网络和缓存坑。但只要把模型目录、启动脚本、GPU/CPU 路线整理好,它已经能成为一个挺实用的本地声音工作台。
如果你也想尝试本地 AI 配音,可以先从 Qwen TTS + Whisper 开始。别一上来追求全模型装满,先让它真正跑起来,这才是新手体验最关键的一步。
附:本文部署环境
| 项目 | 配置 | |—|—| | 系统 | Windows | | GPU | NVIDIA GeForce RTX 3060 Ti 8GB | | 项目目录 | C:GJvoicebox | | 前端地址 | http://127.0.0.1:5173/ | | 后端地址 | http://127.0.0.1:17493/ | | 模型缓存 | C:GJvoicebox.localmodels | | GPU 启动 | start-voicebox-gpu.bat | | CPU 启动 | start-voicebox-cpu.bat | | 关闭服务 | stop-voicebox.bat |
