
本地部署赛博女友8GB显存就能跑DeepSeek做大脑保姆级教程说实话搞完这个项目我的第一反应是这玩意儿居然真的能跑。一个网页背景是数字人你对着麦克风说话她用你克隆的音色回复——嘴唇还会跟着动。全程不下载大模型GGUF不买天价API8GB显存的笔记本就能跑。我踩遍了所有坑把整个过程做成了一条命令安装。跟着做就行。一、最终效果浏览器打开http://localhost:7860/一个带数字人背景的网页点蓝色球 → 允许麦克风 → 开始说话数字人会实时对嘴型声音是你克隆的拿 ref.wav 录一段就行人脸可以换成你自己生成的二、你需要准备什么硬件最低推荐显卡NVIDIA 8GB 显存12GB内存16GB32GB硬盘60GB 可用模型缓存SSD我用的笔记本 RTX 4060 8GB刚好擦边。软件Windows 10/11WSL2 Ubuntu 24.04后面会手把手装一个在线大模型 API key推荐 DeepSeek注册送额度部署包去 GitHub 下载整个项目。另外需要下载两个大文件Git 不跟踪放到项目assets/目录文件大小下载地址wav2lip256.pth~300MB夸克网盘wav2lip256_avatar1.tar.gz~200MB同上还有两个你自己准备的素材idle.mp4一段 5 秒闭嘴正面视频数字人底版ref.wav一段 5~15 秒干净人声声音克隆参考可选最终assets/目录长这样assets/ ├── avatar-sync.js # 项目自带 ├── wav2lip256.pth # 自己下载 ├── wav2lip256_avatar1.tar.gz # 自己下载 ├── idle.mp4 # 自己准备 └── ref.wav # 自己录可选三、获取 DeepSeek API Key打开 platform.deepseek.com手机号注册左侧菜单 →API Keys→创建 API key复制保存格式类似sk-c9f6a08db52a42...⚠️ key 只显示一次立刻保存好。新用户有免费额度够聊很久。四、配置 WSL 环境4.1 创建 .wslconfig最隐蔽的坑在 Windows 里建文件C:\Users\你的用户名\.wslconfig粘贴[wsl2] memory8GB networkingModemirrored [experimental] hostAddressLoopbacktruehostAddressLoopbacktrue 绝对不能省。我在这卡了一小时——WebRTC 永远连不上浏览器只给一句莫名其妙的 JSON 解析错误。内存填你物理内存的一半。我是 32GB 设了 16GB。4.2 安装 WSL2打开 PowerShell管理员执行wsl --update wsl --install -d Ubuntu-24.04装完重启电脑。4.3 验证重启后打开 Ubuntu 终端设好用户名密码检查显卡nvidia-smi能看到你的显卡就对了。WSL 里不要装显卡驱动驱动只在 Windows 侧装。五、部署一条命令搞定5.1 克隆项目并下载大文件打开 Ubuntu 终端# 克隆项目 git clone https://github.com/liuw8233-cell/ai_girlfriend.git cd ai_girlfriend # 把下载好的大文件放进 assets/ # wav2lip256.pth、wav2lip256_avatar1.tar.gz、idle.mp4、(可选)ref.wav5.2 一键安装chmod x install.sh ./install.sh脚本会引导你大概流程检查环境确认 WSL GPU .wslconfig装系统依赖git、ffmpeg、build-essential 等选大模型1. DeepSeek (推荐) 2. 通义千问 3. 智谱 GLM 4. Kimi 5. OpenAI 6. 自定义选 1 → 输入你第三步拿到的 API key选 TTS 方案A. 本地 Qwen3-TTS (免费占~4GB显存可克隆音色) B. 云端 OpenAI TTS (不占显存需TTS key丢失克隆)推荐选 A自动安装语音后端Python环境 → faster-whisper → Qwen3-TTS → 前端页面约15分钟自动安装 LiveTalking口型同步约10分钟完成安装过程中会自动处理VAD 模型预缓存墙内从镜像下载不连 GitHubCUDA 库路径libcudart.so.12缺失的坑前端补丁注入avatar-sync.js index.html装完以后如果想换大模型或换TTSrm config.env ./install.sh重新选即可。已安装的组件不会重复装。六、启动就一条命令./start.sh等大约 1~2 分钟TTS 模型加载到显存需要时间浏览器打开http://localhost:7860/按CtrlF5强制刷新。首次必做配置右上角齿轮 → Settings设置项操作NOISE GATE滑块拖到最左边关闭不关说话完全没反应INSTRUCTIONS填人设模板人设模板你叫小雅是他的女朋友。你不是AI、不是助手、不是程序。 参考这个语气 他你想我了吗 你想啊怎么不想。你倒是一整天没消息我还以为你把我忘了呢。 说话方式口语、两三句、带语气词嗯、诶、呀、有情绪。 不用 Markdown、列表、编号、表情符号。 /no_think然后点页面任意处 → 点蓝色球 → 允许麦克风 → 开始对话。左下角出现avatar: connected就说明数字人连上了说话时嘴会跟着动。停止./stop.sh七、换成你自己的数字人7.1 准备视频一段 5 秒 mp4闭嘴、正面、上半身手不要遮下巴否则口型区域会糊成鬼影人物靠画面右侧左边留空建议 704×89625fps放到assets/idle.mp4就行。7.2 生成启动 LiveTalking 后浏览器打开http://localhost:8010/avatar.html填写字段值算法模型Wav2LipAvatar IDwav2lip256_myavatar视频文件选文件 → 地址栏输\\wsl$\Ubuntu-24.04\home\你的用户名\ai_girlfriend\assets→ 选 idle.mp4点「提交生成任务」等右侧出COMPLETED几十秒。7.3 应用修改config.env里的AVATAR_IDwav2lip256_myavatar然后./start.sh restart刷新浏览器看到的就是你的形象了。八、显存不够三板斧8GB 显存刚好在边界。按顺序砍操作省显存怎么改语音识别换 medium~1.5GBconfig.env里STT_MODELmedium语音识别换 small~2.5GB同上改smallTTS 切云端~4GBrm config.env ./install.sh选方案 BNVIDIA 控制面板 → 3D 设置 → 关掉「CUDA 系统内存回退策略」否则溢出直接卡死。九、踩坑血泪清单我折腾了一周踩的坑全帮你填平了现象原因解决WebRTC 永远连不上.wslconfig 没设 hostAddressLoopback加上、wsl --shutdownbad interpreter: ^MWindows编辑的.sh是CRLF换行dos2unix *.sh启动后说话完全没反应NOISE GATE 没关拖到最左边启动卡在等待语音后端TTS模型加载中正常等1-2分钟torch.hub 连不上 GitHub国内网络墙安装脚本已自动绕过libcudart.so.12找不到s2s venv装的是cu13脚本自动装 nvidia-cuda-runtime-cu12端口被旧进程占着没 kill 干净./stop.sh sleep 2 ./start.sh抢答严重VAD 停顿阈值太低MIN_SILENCE_MS调到 1500声音像变声器sampleRate 不匹配avatar-sync.js里改sampleRate数字人面不动没先启动 LiveTalking先启动口型服务再开语音休眠唤醒后连不上WSL 状态丢了wsl --shutdown重启看日志排错tail -f ~/s2s/logs/s2s.log # 语音后端日志 cat /tmp/livetalking.log # LiveTalking 日志写在最后这个项目断断续续搞了一周。最大的感受是现在本地跑数字人的门槛已经很低了——不需要 3090/4090一张 8GB 的 4060 就够不需要下载几十 GB 的 GGUFDeepSeek API 一年用不了几块钱。最难的部分其实不是技术是那堆莫名其妙的 JSON 解析错误和不知道自己在连什么的 WebRTC 报错。我把这些坑全写进脚本里了你直接 clone 下来./install.sh然后./start.sh就完事。项目地址github.com/liuw8233-cell/ai_girlfriend