私藏好物|我把一个会聊天的AI数字人装进了自己电脑
今天必须按头安利一个我最近私藏到舍不得分享的宝藏玩法——把自己电脑变成一个会语音聊天、有嘴型、像真人一样看着你说话的 AI 数字人。🌟
不开玩笑,语音、对话、形象全在你本机跑,云端一点不上传。社恐党、隐私党、爱折腾党,这篇真的可以冲。
一、为什么我愿意按头安利
✅ 隐私零上传:声音、对话、脸,全在本地,不进任何云端服务器。
✅ 用完即收:一键关掉,WSL、显存全释放,电脑秒回低占用。
✅ 可玩性拉满:换模型、换音色、换脸,全在自己掌控里。
二、这套到底由什么拼起来
一句话链路:你说话 → 本地识别成文字 → 大模型想答案 → 本地合成语音 → 数字人实时对口型播出来。
🧠 大脑:硅基流动大模型 API(聪明选 DeepSeek-V3.2)
👄 嘴巴:本地 GPU 跑 Qwen3-TTS,自然还不卡
👂 耳朵:faster-whisper 本地语音识别
🎭 脸:LiveTalking + Wav2Lip,实时嘴型对齐

三、上手难吗?准备清单先收好
✓ Windows 11 + NVIDIA 显卡(驱动正常)
✓ 开了 WSL2,装 Ubuntu-24.04
✓ 项目统一放 C:\AI\cyber-girlfriend
新机器先开 WSL:
再配 WSL 网络,编辑 C:\Users\你的用户名\.wslconfig:
networkingMode=mirrored
[experimental]
hostAddressLoopback=true
⚠️ 全篇记住一个铁律:一律用 127.0.0.1,别写 localhost!实测 localhost 会连不上。
四、保姆级步骤(照抄就行)
1)配置大模型 编辑 api-config.env:
LLM_MODEL=deepseek-ai/DeepSeek-V3.2
LLM_API_KEY=你的API_KEY
2)下载本地语音模型 依次跑:
download-faster-whisper-medium.cmd
3)换脸(可选) 有图就跑 generate-idle-video-api.cmd,自动生成 idle.mp4;自己生成的视频放 assets\idle.mp4 后跑 change-avatar.cmd。视频要求:704×896、25fps、5 秒、嘴唇闭合、轻微呼吸眨眼。

五、日常打开就能聊
打开 http://127.0.0.1:7860/ # Ctrl+F5 强刷
看到左下角 avatar: video 就能按住语音球开聊
六、用完一键收,电脑不卡
这一点对只拿来娱乐的人太友好了,关掉显存立刻空出来。
七、几个高频疑问(提前避坑)
❓ 页面打不开 → 确认是 127.0.0.1,不是 localhost
❓ 有声音嘴不动 → 看左下角是否 avatar: video,不是就 Ctrl+F5 重连
❓ 觉得不够聪明 → 改 api-config.env 换 DeepSeek-V3.2
❓ 想完全离线 → 用 start-all-4b-local.cmd(更慢更吃配置)
八、冲不冲?
从环境到对话整套已经能在普通 Win11 + N 卡机器上跑通。它不一定完美,但胜在可控、私密、可折腾——这正是本地 AI 的乐趣。
宝子们,这种又护隐私又解压的玩法,真的不冲一下吗?👇
*本文整理自个人部署笔记,命令路径以你自己的项目目录为准。
