• 欢迎访问誉卿博客,推荐使用最新版火狐浏览器和 Chrome 浏览器访问本网站。

  • 初不解禅心未住,悟后逍遥游处方。 山水有情皆由心,见山见水皆天堂。

私藏好物|我把一个会聊天的AI数字人装进了自己电脑

AI yqdnsjs 2天前 9次浏览 0个评论 扫描二维码

私藏好物|我把一个会聊天的AI数字人装进了自己电脑

今天必须按头安利一个我最近私藏到舍不得分享的宝藏玩法——把自己电脑变成一个会语音聊天、有嘴型、像真人一样看着你说话的 AI 数字人。🌟

不开玩笑,语音、对话、形象全在你本机跑,云端一点不上传。社恐党、隐私党、爱折腾党,这篇真的可以冲。

一、为什么我愿意按头安利

隐私零上传:声音、对话、脸,全在本地,不进任何云端服务器。

用完即收:一键关掉,WSL、显存全释放,电脑秒回低占用。

可玩性拉满:换模型、换音色、换脸,全在自己掌控里。

二、这套到底由什么拼起来

一句话链路:你说话 → 本地识别成文字 → 大模型想答案 → 本地合成语音 → 数字人实时对口型播出来。

🧠 大脑:硅基流动大模型 API(聪明选 DeepSeek-V3.2)

👄 嘴巴:本地 GPU 跑 Qwen3-TTS,自然还不卡

👂 耳朵:faster-whisper 本地语音识别

🎭 :LiveTalking + Wav2Lip,实时嘴型对齐

三、上手难吗?准备清单先收好

✓ Windows 11 + NVIDIA 显卡(驱动正常)

✓ 开了 WSL2,装 Ubuntu-24.04

✓ 项目统一放 C:\AI\cyber-girlfriend

新机器先开 WSL:

wsl –install -d Ubuntu-24.04

再配 WSL 网络,编辑 C:\Users\你的用户名\.wslconfig

[wsl2]
networkingMode=mirrored

[experimental]
hostAddressLoopback=true

⚠️ 全篇记住一个铁律:一律用 127.0.0.1,别写 localhost!实测 localhost 会连不上。

四、保姆级步骤(照抄就行)

1)配置大模型 编辑 api-config.env

LLM_BASE_URL=https://api.siliconflow.cn/v1
LLM_MODEL=deepseek-ai/DeepSeek-V3.2
LLM_API_KEY=你的API_KEY

2)下载本地语音模型 依次跑:

download-qwen3-tts-q8.cmd
download-faster-whisper-medium.cmd

3)换脸(可选) 有图就跑 generate-idle-video-api.cmd,自动生成 idle.mp4;自己生成的视频放 assets\idle.mp4 后跑 change-avatar.cmd。视频要求:704×896、25fps、5 秒、嘴唇闭合、轻微呼吸眨眼。

五、日常打开就能聊

start-all-api-gpu-tts.cmd # 启动
打开 http://127.0.0.1:7860/ # Ctrl+F5 强刷
看到左下角 avatar: video 就能按住语音球开聊

六、用完一键收,电脑不卡

stop-local-services.cmd # 关语音+数字人+停WSL

这一点对只拿来娱乐的人太友好了,关掉显存立刻空出来。

七、几个高频疑问(提前避坑)

❓ 页面打不开 → 确认是 127.0.0.1,不是 localhost

❓ 有声音嘴不动 → 看左下角是否 avatar: video,不是就 Ctrl+F5 重连

❓ 觉得不够聪明 → 改 api-config.env 换 DeepSeek-V3.2

❓ 想完全离线 → 用 start-all-4b-local.cmd(更慢更吃配置)

八、冲不冲?

从环境到对话整套已经能在普通 Win11 + N 卡机器上跑通。它不一定完美,但胜在可控、私密、可折腾——这正是本地 AI 的乐趣。

宝子们,这种又护隐私又解压的玩法,真的不冲一下吗?👇

*本文整理自个人部署笔记,命令路径以你自己的项目目录为准。

喜欢 (0)

您必须 登录 才能发表评论!