
GPT-SoVITS 实战从 1 分钟素材到能直接用的 TTS 模型【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS想给自己录的短视频配一段解说音但不想搭录音环境也不想每句话都现录。用 GPT-SoVITS几分钟录音素材就能克隆出你的声音之后模型替你读任何文字省嗓子。项目速览GPT-SoVITS 是什么传统语音合成系统每加一个新音色都要录制几小时素材个人用户玩不起。GPT-SoVITS 最大的卖点是少 1 分钟语音就能训出一个能用的 TTS 模型也就是少样本语音克隆。它适合短视频作者、内容创作者以及想把个性化音色接进自己产品的开发者不需要深度学习背景浏览器打开 WebUI 就能操作。️ 环境与启动怎么安装并打开系统要求Win10/macOS 10.15/Ubuntu 18Python 3.8-3.10内存至少 8GB。先把仓库克隆下来地址https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS然后在根目录执行这条命令会一次装好全部依赖并下载预训练模型需要本机先装好 conda--device按你的显卡改成对应值bash install.sh --device CU128 --source HF这条命令启动 WebUI 主页面装完后浏览器打开 http://localhost:9874 就是完整工作流python webui.pyWindows 整合包、Docker 等其他安装方式见仓库 README。核心工作流一段素材怎么变成你的声音WebUI 把全程分成获取素材、训练、推理三大块数据流方向是原始音频 → 训练集 → 模型 → 语音。素材预处理分离、切分、识别做什么原始音频通常带背景音乐和噪音且单条太长不能直接进训练。先用 UVR5 分离出人声再把长音频切成 3-10 秒的短片段最后用语音识别ASR给每段自动生成初始文本标注。在哪做全在0-前置数据集获取工具页签里点选完成切分功能对应音频切割脚本。做完后你看到什么输出目录里出现一批切好的 wav 短音频以及一份与之一一对应的标注文本文件文件名互相能对得上。训练集格式化与两阶段微调做什么把音频标注配对成标准训练集然后依次训练两个模型——GPT 模型负责文本到语义SoVITS 模型负责语义到音频。在哪做1A-训练集格式化工具页签点一键三连完成格式化1B-微调训练页签填好训练集路径后开始训练训练逻辑对应GPT训练脚本。做完后你看到什么终端训练日志正常滚动输出目录里陆续出现 ckpt 模型文件训练结束后挑一个试听效果好的存档即可。推理文本变成你的声音做什么输入想合成的文字并选择语言文本里夹杂其他语言也能自动处理同时上传一段简短的参考音频让输出模仿它的语气和节奏。在哪做1C-推理页签。做完后你看到什么一个可播放的 wav 文件满意就点保存导出。效果调优不像本人怎么办症状克隆音色不像你、发闷带电流声——多半是素材不够干净回去重做分离和降噪素材越干净越稳。症状语气断裂、有奇怪停顿——多半是切分太长调低切分阈值重新生成更短的均匀片段再训。症状个别词读错——多半是 ASR 初始标注有误打开校对界面逐字改正再训练见效最快。 延伸玩法把模型打包成 API 服务除了 WebUI根目录还附带现成的 API 推理脚本能把训好的模型包装成本地服务用程序发送文本就能取回音频方便接进自己的应用或自动化工作流。接口支持流式输出体验接近实时对话。具体参数自己调仓库里有 demo。收尾先录一分钟干净的自己把整套流程跑通一遍。更细的参数与多语言说明见仓库里的README。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考