• 欢迎访问誉卿博客,推荐使用最新版火狐浏览器和 Chrome 浏览器访问本网站。

  • 初不解禅心未住,悟后逍遥游处方。 山水有情皆由心,见山见水皆天堂。

我把 AI 配音、克隆声音、语音转文字都搬回了本地电脑

AI yqdnsjs 1个月前 (08-28) 128次浏览 扫描二维码
Voicebox 本地 AI 声音工作室封面

 

Voicebox 本地部署实测:支持 GPU 加速、CPU 备用、多个 TTS / Whisper / LLM 模型,一台普通 Windows 主机也能搭自己的声音工作室。

最近我折腾了一个很有意思的开源项目:Voicebox。

它不是单纯的文字转语音工具,而更像一个“本地 AI 声音工作室”:可以克隆声音、生成配音、用 Whisper 做语音转文字,还能用本地小语言模型处理文本。重点是:声音样本、生成内容、模型缓存都可以放在自己的电脑里。

这点对经常做视频配音、播客草稿、文章朗读、AI 角色声音、离线语音工具的人来说,很香。

我这次是在 Windows 上部署,机器是 NVIDIA RTX 3060 Ti 8GB。CPU 不算强,所以路线很明确:能走 CUDA 就优先走 GPU,同时保留 CPU 启动方式兜底。

Voicebox 能做什么?

简单说,它把几类常用声音能力放在了一个界面里:

  • 文字转语音:把文章、脚本、旁白生成语音
  • 声音克隆:上传一小段参考音频,创建自己的声音档案
  • 预设声音:不想克隆时,可以直接用内置声线
  • 语音转文字:集成 Whisper 模型做转写
  • 多模型切换:同一段文字可以换不同引擎试效果
  • 本地运行:模型和数据尽量留在自己的电脑上
Voicebox 模型选择路线图

新手先看结论:推荐这样用

如果你是第一次部署,不建议一上来把所有模型都装满。

我实测下来,新手最舒服的路线是:

1. 先启动 GPU 模式 2. 先用 Qwen TTS 0.6B / 1.7B 做中文配音 3. 想要更广语言覆盖,再试 Chatterbox 4. 想要轻量快速,就用 Kokoro 5. Whisper 转写按需选 base / small / medium 6. TADA 最后再装,因为它有额外大依赖

我本地测试结果:

| 类型 | 已通过模型 | |—|—| | TTS 生成 | Qwen TTS 0.6B / 1.7B、Qwen CustomVoice 0.6B / 1.7B、LuxTTS、Chatterbox、Chatterbox Turbo、Kokoro | | 语音转文字 | Whisper base / small / medium / large / turbo | | 本地 LLM | Qwen3 0.6B / 1.7B / 4B | | 暂不建议新手先折腾 | TADA 1B / TADA 3B,因为 HumeAI/tada-codec 额外依赖很大 |

这次完整实测是 16/18 个模型通过。剩下 2 个 TADA 不是主模型没下好,而是它还有一套隐藏的 codec / aligner 依赖,体积大、下载慢,新手可以先跳过。

 

Voicebox 本地部署结构图

我的部署思路:尽量不污染系统

这类 AI 项目最烦的地方不是“难”,而是容易把系统 Python、缓存目录、环境变量弄得一团糟。

所以我这次部署时采用了隔离策略:

  • 项目放在:C:GJvoicebox
  • Python 虚拟环境放在:C:GJvoicebox.venv
  • 模型缓存放在:C:GJvoicebox.localmodels
  • 临时文件放在:C:GJvoicebox.localtmp
  • 下载文件放在:C:GJvoicebox.localmanual-downloads
  • GPU / CPU 启动脚本分开

这样做的好处是:不轻易改系统全局配置,不影响别的 AI 项目,后续如果不要了,也比较容易整体清理。

一键启动方式

部署好以后,日常使用不需要再敲一堆命令。

项目根目录里有两个启动入口:

<code class="language-bat">start-voicebox-gpu.bat</code>

这一行的意思:

  • 双击它会启动 GPU / CUDA 模式
  • 适合 NVIDIA 显卡用户
  • 我这台 RTX 3060 Ti 实测可用
<code class="language-bat">start-voicebox-cpu.bat</code>

这一行的意思:

  • 双击它会启动 CPU 模式
  • 适合显卡不可用、CUDA 出问题、或者只想轻量测试的时候
  • 速度会慢一些,但可以作为兜底路线

关闭服务用:

<code class="language-bat">stop-voicebox.bat</code>

这一行的意思:

  • 停止 Voicebox 后端和前端服务
  • 释放本地端口和显存
  • 不想让模型常驻后台时就双击它

启动成功后,浏览器打开:

<code class="language-text">http://127.0.0.1:5173/</code>

这一行的意思:

  • 127.0.0.1 表示只在本机访问
  • 5173 是前端页面端口
  • 不暴露到局域网,更适合个人本地使用
Voicebox 第一次生成声音流程图

第一次创建声音:参考音频别太长

新手最容易踩的坑之一:参考音频太长。

Voicebox 创建克隆声音时,参考音频建议控制在 30 秒以内。我之前上传过较长音频,页面直接提示:

<code class="language-text">Invalid reference audio: Audio too long (maximum 30.0 seconds)</code>

这一行的意思:

  • 参考音频超过 30 秒
  • 不是模型坏了
  • 剪短音频后重新上传即可

推荐参考音频:

  • 10 到 20 秒
  • 背景噪音少
  • 只有一个人说话
  • 语速自然
  • 最好和参考文本完全对应

中文配音推荐:先用 Qwen TTS

如果主要做中文配音,我建议新手先从 Qwen TTS 开始。

我本地实测:

| 模型 | 结果 | 适合用途 | |—|—|—| | Qwen TTS 0.6B | 通过 | 快速试音、短句测试、轻量配音 | | Qwen TTS 1.7B | 通过 | 更稳定的正式中文配音 | | Qwen CustomVoice 0.6B | 通过 | 不上传参考音频,直接用预设声线 | | Qwen CustomVoice 1.7B | 通过 | 预设声线 + 更好质量 |

我的建议:

  • 试效果:先用 0.6B
  • 正式导出:再用 1.7B
  • 不想折腾克隆声音:用 CustomVoice 的预设男声/女声

Chatterbox:适合更丰富的声音表现

Chatterbox 多语言版和 Chatterbox Turbo 也都跑通了。

我的感受是:

  • Chatterbox 多语言:更适合多语言、克隆声音
  • Chatterbox Turbo:更适合英文和带情绪标签的表达

比如 Chatterbox Turbo 支持类似这样的情绪标签:

<code class="language-text">[laugh] That was unexpected.</code>

这一行的意思:

  • [laugh] 表示笑声或带笑的表达
  • 后面的英文会按 Chatterbox Turbo 的方式生成
  • 这类标签不建议直接丢给所有模型,因为有些模型会把标签念出来

Kokoro:小而快,适合轻量场景

Kokoro 是这次体验里很适合新手的轻量模型。

它的特点:

  • 模型小
  • 加载快
  • 预设声音多
  • 对电脑压力小

如果你只是想快速生成一段英文、测试工作流、或者电脑显存不大,Kokoro 很适合作为入门模型。

Whisper:本地转写也能用

这次 Whisper 五个模型都测试通过:

| Whisper 模型 | 实测结果 | 新手建议 | |—|—|—| | base | 通过 | 最轻量,适合快速试 | | small | 通过 | 速度和效果比较平衡 | | medium | 通过 | 中文转写更稳一些 | | large | 通过 | 更大,更吃资源 | | turbo | 通过 | 速度不错,适合常用 |

如果你只是做中文短音频转写,我建议先试:

1. small 2. medium 3. turbo

本地 Qwen3 LLM:能跑,但 4B 已经贴近 8GB 显存上限

Voicebox 里还集成了本地 Qwen3 LLM,用来做文本处理、润色、角色化表达等。

我这台 8GB 显卡实测:

| 模型 | 结果 | 备注 | |—|—|—| | Qwen3 0.6B | 通过 | 推荐日常轻量使用 | | Qwen3 1.7B | 通过 | 更稳一点 | | Qwen3 4B | 通过 | 能跑,但显存压力接近上限 |

4B 虽然通过了,但显存最高接近 7.7GB。我的建议是:除非你确实需要更强文本能力,否则日常用 0.6B 或 1.7B 更舒服。

TADA 为什么先不推荐新手折腾?

TADA 本身不是不能用,而是它额外依赖比较大。

主模型下载完以后,它还会需要:

<code class="language-text">HumeAI/tada-codec</code>

这一行的意思:

  • 这是 TADA 的额外 codec / aligner 依赖
  • 不完全等同于页面上显示的 TADA 主模型
  • 如果缺这个,可能会出现 IncompleteRead、Connection broken 一类错误

我这边已经补齐了 TADA 的核心英文/中文依赖:

<code class="language-powershell">..venvScriptspython.exe .toolsverify_tada_codec.py --core</code>

这行命令的意思:

  • 用项目本地 Python 运行校验脚本
  • 只检查 TADA 英文/中文常用核心文件
  • 当前核心文件校验结果是 13/13 完整

如果想补齐全量 TADA 依赖,可以继续断点下载:

<code class="language-powershell">..venvScriptspython.exe -u .toolsdownload_tada_codec_resume.py --endpoint https://hf-mirror.com --all</code>

这行命令的意思:

  • 用项目本地 Python 运行断点下载脚本
  • -u 表示实时输出进度,方便观察
  • --endpoint https://hf-mirror.com 表示使用 Hugging Face 镜像
  • --all 表示补齐所有语言 aligner

但新手真的可以先不碰 TADA。先把 Qwen、Chatterbox、Kokoro、Whisper 跑顺,体验会好很多。

Voicebox 常见报错排查图

常见坑:Failed to fetch 是什么?

如果页面弹出:

<code class="language-text">Failed to fetch</code>

这一行的意思通常是:

  • 前端页面访问不到后端
  • 后端服务没启动
  • 端口不对
  • 浏览器请求地址没有代理到本地后端

排查顺序:

1. 先确认是否启动了 start-voicebox-gpu.bat 2. 再打开 http://127.0.0.1:5173/ 3. 如果还不行,先执行 stop-voicebox.bat 4. 然后重新启动 GPU 或 CPU 模式

配图建议:

  • 截 Failed to fetch 红色弹窗
  • 截启动成功后的健康页面或主页

常见坑:模型显示已下载,但生成还是报错

这个坑我也踩了。

有些模型页面显示已下载,只代表主模型文件存在;但真正运行时可能还会加载额外依赖。

典型例子就是 TADA:

<code class="language-text">Connection broken: IncompleteRead(...)</code>

这一行的意思:

  • 后端正在下载某个大依赖
  • 网络中途断了
  • 文件没完整落盘
  • 不是你的文字输入问题

解决思路:

  • 用断点下载脚本补完整文件
  • 用 verify_tada_codec.py 校验大小
  • 不要只看网页上的 downloaded 状态

常见坑:模型切换后卡住

多个大模型来回切换时,显存可能不会马上完全释放。

我做了一个优化:生成前尽量卸载其它 TTS 模型,减少模型互相占显存的问题。

如果你手动使用时感觉卡住,可以按这个顺序处理:

1. 点页面里的取消或等待当前任务失败 2. 双击 stop-voicebox.bat 3. 等 5 到 10 秒 4. 再双击 start-voicebox-gpu.bat

Voicebox 本机模型测试结果卡片

我的实测模型报告

本地实测报告摘要如下:

| 模型 | 类型 | 结果 | |—|—|—| | qwen-tts-0.6B | TTS | 通过 | | qwen-tts-1.7B | TTS | 通过 | | qwen-custom-voice-0.6B | TTS | 通过 | | qwen-custom-voice-1.7B | TTS | 通过 | | luxtts | TTS | 通过 | | chatterbox-tts | TTS | 通过 | | chatterbox-turbo | TTS | 通过 | | kokoro | TTS | 通过 | | whisper-base | STT | 通过 | | whisper-small | STT | 通过 | | whisper-medium | STT | 通过 | | whisper-large | STT | 通过 | | whisper-turbo | STT | 通过 | | qwen3-0.6b | LLM | 通过 | | qwen3-1.7b | LLM | 通过 | | qwen3-4b | LLM | 通过 | | tada-1b | TTS | 暂跳过,额外依赖未全量补齐 | | tada-3b-ml | TTS | 暂跳过,额外依赖未全量补齐 |

这个结果对新手来说已经够用了:日常配音、克隆声音、转写、轻量文本处理都可以先跑起来。

适合谁?

我觉得 Voicebox 特别适合这几类人:

  • 做短视频配音的人
  • 想把文章批量转成音频的人
  • 想尝试本地声音克隆的人
  • 不想把声音样本上传到云端的人
  • 喜欢折腾开源 AI 工具的人
  • 需要本地 Whisper 转写的人

如果你追求“打开网页立刻用”,云服务更省心。 如果你更在意本地控制、隐私、可玩性和长期成本,那 Voicebox 很值得折腾。

新手部署建议

我的建议不是“全都装”,而是分阶段:

第一阶段:跑通界面

  • 启动 GPU 模式
  • 打开本地网页
  • 上传 10 到 20 秒参考音频
  • 用 Qwen TTS 0.6B 生成一句话

第二阶段:稳定常用模型

  • Qwen TTS 1.7B
  • Qwen CustomVoice
  • Chatterbox
  • Kokoro
  • Whisper small / medium

第三阶段:再补大模型

  • Whisper large
  • Qwen3 4B
  • TADA 全量依赖

这样部署体验会轻松很多,不会一开始就被十几个 GB 的模型下载劝退。

结尾

这次折腾下来,我最大的感受是:

本地 AI 声音工具已经越来越像“可用的软件”,而不只是开发者玩具了。

Voicebox 还不是那种完全无脑的一键工具,尤其 Windows + Hugging Face 大模型下载这块,偶尔会有网络和缓存坑。但只要把模型目录、启动脚本、GPU/CPU 路线整理好,它已经能成为一个挺实用的本地声音工作台。

如果你也想尝试本地 AI 配音,可以先从 Qwen TTS + Whisper 开始。别一上来追求全模型装满,先让它真正跑起来,这才是新手体验最关键的一步。

附:本文部署环境

| 项目 | 配置 | |—|—| | 系统 | Windows | | GPU | NVIDIA GeForce RTX 3060 Ti 8GB | | 项目目录 | C:GJvoicebox | | 前端地址 | http://127.0.0.1:5173/ | | 后端地址 | http://127.0.0.1:17493/ | | 模型缓存 | C:GJvoicebox.localmodels | | GPU 启动 | start-voicebox-gpu.bat | | CPU 启动 | start-voicebox-cpu.bat | | 关闭服务 | stop-voicebox.bat |

 

喜欢 (0)