尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

GPT-SoVITS:1 分钟音频克隆音色、5 秒参考音频直接出中文 TTS 的完整上手指南

GPT-SoVITS:1 分钟音频克隆音色、5 秒参考音频直接出中文 TTS 的完整上手指南 GPT-SoVITS1 分钟音频克隆音色、5 秒参考音频直接出中文 TTS 的完整上手指南【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个开源的少样本语音克隆与文本合成工具丢给它 1 分钟目标人声微调后即可用这个音色朗读任意文本甚至不训练用 5 秒参考音频就能零样本合成。它带 WebUI、内置数据集制作工具链切分、降噪、ASR 自动标注、校对并支持中、英、日、韩、粤五种语言。最短路径从克隆仓库到第一次合成结论先说在装有 NVIDIA 显卡的机器上从git clone到在浏览器里合成出第一句中文按下面 5 步走即可Windows 用户也可下载官方整合包解压后双击go-webui.bat直接跳过 1–3 步。克隆仓库并创建环境git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits预期结果一个名为GPTSoVits的 Python 3.10 虚拟环境被激活。一键安装依赖并下载预训练模型# Linux / macOS bash install.sh --device CU128 --source HF # Windows pwsh -F install.ps1 --Device CU128 --Source HF--source可选HF、HF-Mirror、ModelScope按你的网络环境选择。预期结果脚本结束时预训练模型已放入GPT_SoVITS/pretrained_models无需手动下载。确保系统里有 FFmpeg手动安装时才需要单独处理conda 用户执行conda install ffmpegUbuntu/Debian 执行sudo apt install ffmpeg libsox-devmacOS 执行brew install ffmpeg。Windows 需将ffmpeg.exe、ffprobe.exe放到项目根目录并安装 Visual Studio 2017 运行库。预期结果终端能正常执行ffmpeg -version。启动 WebUIpython webui.py预期结果浏览器自动打开 Gradio 界面顶部出现1-GPT-SoVITS-TTS、2-GPT-SOVITS-TTS、0-前置数据集获取工具等标签页。零样本试听进入1-GPT-SoVITS-TTS→1C-inference上传一段 5 秒人声作为参考粘贴文本点击合成。预期结果几秒内得到用该音色朗读的音频文件。 各平台测试通过的环境组合见仓库 READMEPython 3.10/3.11 配 CUDA 12.4 或 12.8Apple 芯片、纯 CPU 也有对应组合。核心能力拆解它能做什么5 秒零样本合成——不训练也能用。上传任意 5 秒人声当参考直接输入文本合成适合快速验证这个音色适不适合我的内容。零样本相似度有限但足以判断值不值得继续投入。1 分钟微调——把音色焊住。只要 1 分钟目标人声训练数据微调后音色相似度和真实感会明显提升这是项目 README 里明确写出的能力定位1 min voice data can also be used to train a good TTS model。训练集制作有完整工具链兜底音频自动切分、可选降噪、ASR 自动转写Fun-ASR-Nano / SenseVoice / FunASR、文本校对都集成在 WebUI 的0-前置数据集获取工具标签页里不需要自己写脚本。五语种合成与跨语言推理。支持中文、英文、日语、韩语、粤语的训练与推理且能用 A 语言的训练集推 B 语言的文本。v2 之后还优化了文本前端预训练数据从 2k 小时扩展到 5k 小时低质量参考音频的合成效果也做了专门改进。推理速度有实测数字。官方 README 给出 v2ProPlus 的 RTFRTX 4090 上 0.014RTX 4060Ti 上 0.028Apple M4 纯 CPU 上 0.526——换算过来4090 上合成约 4 分钟、1400 词左右的音频只需 3.36 秒日常配音场景够用。原理速览为什么两段式能做到像GPT-SoVITS 的推理管线是分两段的代码里对应 GPT_SoVITS/AR/GPT 段和 GPT_SoVITS/module/SoVITS 段。第一段负责说什么文本先经各语言文本前端中文用 G2PW 处理多音字见 GPT_SoVITS/text/规整成音素序列再由预训练 GPT 模型文件名里的s1bert25hz即基于 BERT 的文本编码器逐帧生成 25Hz 的语义 token。语义 token 是抽象的内容单位和具体音色解耦所以 5 秒参考音频也能引导它说出像样的内容。第二段负责谁来读SoVITS 模型以 GPT 产出的语义 token 为输入参考音频提供音色条件生成声学特征最后由 BigVGAN 声码器GPT_SoVITS/BigVGAN/来自 NVIDIA重建波形。v3/v4 系列对声码器做了升级v4 还修复了 v3 因非整数倍上采样带来的金属质感 artifacts并原生输出 48kHz 音频——v3 只原生输出 24kHz高音容易发闷。这也是 v4 被官方视为 v3 直接替代品的原因。正因为内容与音色分属两段、各自可单独微调项目才支持零样本参考音频直接进第二段、LoRA 微调只训练小权重见 GPT_SoVITS/s2_train_v3_lora.py这类玩法数据需求才压得这么低。场景与玩法三个可复现的用法玩法一给自己做一条播客旁白零样本起步录一段自己 5–10 秒的干净人声存成 wav。打开1C-inference上传参考音频粘贴旁白稿勾选对应语言。试听后调语速/语气参数重合成导出用。效果不需要任何训练几分钟拿到成片如果觉得音色还不够贴再走玩法二。玩法二用 1 分钟素材微调专属音色少样本全流程0-前置数据集获取工具填音频路径 → 一键切分 →人声混背景音乐就先 UVR5 分离→ ASR 自动生成文本。在1B-ASR批量打标校对转写文本错字会直接进训练集值得过一遍。标签页 1/2 分别微调 GPT 和 SoVITS 两段模型。回到1C-inference选中新训出的权重合成。效果训练完成后同一文本的音色贴合度明显高于零样本仓库 README 的 v3 版本说明也指出v3/v4 合成音色更贴近参考音频本身。玩法三接到自己的应用里API 调用仓库提供 api_v2.py 与 api.py 两个 HTTP 接口入口参数化调用模型进行合成适合把 TTS 嵌进 Web 服务、游戏、有声内容流水线。配合config.py中的路径配置即可指定模型与输出目录需要批量生产时参考 GPT_SoVITS/prepare_datasets/ 下的脚本化流程管理素材。⚠️ 跨语言提示粤语和中文在 ASR 侧走不同后端粤语走经典 FunASR训练集语言标注zh/en/ja/ko/yue要写对否则合成效果会打折扣。标注格式是音频路径|说话人|语言|文本见 README 的 Dataset Format 一节。排错手册高频报错与解法现象常见原因解法Windows 启动即报 ffmpeg 相关错误缺少 ffmpeg将ffmpeg.exe/ffprobe.exe放到项目根目录并安装 Visual Studio 2017 C 运行库推理时提示找不到模型/权重预训练模型没放到GPT_SoVITS/pretrained_models或版本不匹配用install.sh/install.ps1重装手动下载时核对 config.py 里各版本对应的权重文件名v4 需gsv-v4-pretrained/s2Gv4.pth等中文合成报文本前端错误缺 G2PW 中文前端模型下载 G2PWModel 解压改名放到GPT_SoVITS/text仅中文 TTS 需要显存不足/训练中断模型与批处理占用过高启用半精度Docker 环境变量is_halftrue或启动参数或换小样本训练Docker 容器行为异常Windows Docker Desktop 默认共享内存过小在 docker-compose.yaml 中把shm_size调大如16gASR 首次使用卡住或失败模型需联网自动下载首次使用让程序自动下载离线环境需手动把 FunASR 模型放入tools/asr/modelsREADME 有各模型对应下载地址Mac 上训练出的模型明显差Apple 芯片 GPU 训练效果低于其他设备官方建议 Mac 上训练用 CPU--device MPS/CPU安装时选 CPU 训练合成音频带金属声/高音发闷在用 v3 或其声码器升级到 v4 权重原生 48kHz 输出版本差异详见 README 的 V4 Release Notes收尾GPT-SoVITS 的价值很直接5 秒参考就能出活1 分钟素材就能微调出可用的专属音色配套工具链让新手不必离开 WebUI 就能完成全流程。下一步建议先跑通零样本合成再用 1 分钟素材完整走一遍切分→ASR→校对→微调流程把 docs/cn/ 的中文文档翻一遍对照操作基本就能覆盖日常使用。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表