尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

VoiceFixer|语音修复命令行工具,一条命令从 2 kHz 拉到 44.1 kHz

VoiceFixer|语音修复命令行工具,一条命令从 2 kHz 拉到 44.1 kHz VoiceFixer语音修复命令行工具一条命令从 2 kHz 拉到 44.1 kHz【免费下载链接】voicefixerGeneral Speech Restoration项目地址: https://gitcode.com/gh_mirrors/vo/voicefixer如果你手里有过一段带噪声、采样率被压到 2 kHz 的闷录音就懂这种痛点去噪滤波器往往把高音一起削掉手动调参常常调不出结果。VoiceFixer 是一个语音修复工具一条命令把这类音频恢复到 44.1 kHz一个模型同时处理噪声、混响、低采样率与削波提供命令行与 Python 两种接口。它到底做了什么技术路径三步走前端模块从受损输入估计出干净的梅尔频谱内置 44.1 kHz 通用神经声码器把它还原成波形模式 1 可加一步高频噪声去除的预处理。看高频部分左图能量被截断在 5 kHz 以下右图谐波一路补到 20 kHz这是低采样率语音增强最关键的一步。三十秒跑起来装完即可跑音频降噪命令行就一行pip install voicefixervoicefixer --infile input.wav --outfile output.wavPython 接入也只要两行from voicefixer import VoiceFixer VoiceFixer().restore(inputinput.wav, outputoutput.wav, mode0)有 GPU 默认启用加--disable-cuda可关闭Python 接口还能通过your_vocoder_func传入自己的 44.1 kHz 声码器。不想写命令用streamlit run test/streamlit.py启动内置网页上传处理。首次运行会自动下载预训练权重到本地缓存视网络情况预留几分钟权重只下一次之后启动直接复用缓存。按损伤程度选档位三档对应不同的模型行为损伤越重档位越高模式适用场景典型输入注意事项0默认一般退化噪声、混响、低采样率日常录音、会议记录默认档最稳定1明显高频噪声环境噪声、电流底噪先做高频去除再修复2严重受损音频老磁带、严重削波以训练模式运行结果有波动拿不准就从默认档开始效果不够再升档也可以--mode all一次产出三份输出文件逐段对比后再挑。用的人踩过的坑只支持 .wav 吗命令行严格只收 .wavFLAC、M4A 这类格式要先转一下。Python 接口直接读文件传 .flac 不用转。一条要跑多久CPU 上 1 分钟音频大约 30~60 秒开 GPU 能压到十秒上下。批量处理时把--infolder指向文件夹会自动处理里面全部 .wav适合一次清理整个录音目录。模式怎么选默认 0覆盖多数损伤场景修复后仍有明显噪声再试 12 是为严重受损音频准备的搏一搏档位结果有波动。能实时吗不能。它是离线工具长音频按 30 秒一段切分后逐段处理没法接入实时音频流准实时场景建议先把整段文件过一遍再分发。想看实现的话核心修复模型在voicefixer/restorer/目录声码器在voicefixer/vocoder/目录对应论文 arXiv: 2109.13731。【免费下载链接】voicefixerGeneral Speech Restoration项目地址: https://gitcode.com/gh_mirrors/vo/voicefixer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表