尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Demucs音频分离上手全攻略:一条命令把人声、鼓点、贝斯从歌曲里拆出来

Demucs音频分离上手全攻略:一条命令把人声、鼓点、贝斯从歌曲里拆出来 Demucs音频分离上手全攻略一条命令把人声、鼓点、贝斯从歌曲里拆出来【免费下载链接】demucsCode for the paper Hybrid Spectrogram and Waveform Source Separation项目地址: https://gitcode.com/gh_mirrors/de/demucsDemucs是一款开源音频分离工具核心功能是把一首歌里的人声、鼓点、贝斯和伴奏精准拆成独立的音轨文件。它由Facebook Research团队开发v4版本采用混合Transformer架构在MUSDB HQ评测集上达到9.00 dB的SDR信号失真比你可以把它理解成分离纯度的分数处于当前音频分离领域的第一梯队。说到这儿很多人的第一反应是这和去人声伴奏有啥区别别急我们马上会看到两者差别大得不是一点半点。当你想翻唱、做采样或剪视频却卡在没有伴奏这一关假设你想录一首翻唱需要一段干净的伴奏。你搜遍全网能找到的无非三种结果音质很差的消音版、别人翻弹的版本或者干脆没有。退一步说就算伴奏找到了想要只有鼓点来做个采样或者只有人声来混音重做那就更没处找了。Demucs解决的就是这类把混好的歌拆开的诉求给它一段完整的混音它还给你几轨相对干净的独立音轨。视频剪辑者可以用它去掉背景音乐里的人声音乐人可以拿到单独的鼓点loop做节拍素材播客制作者可以拿它清理访谈录音的底噪。一个工具多条用途。先看一笔账你的痛点Demucs怎么对症下药与其罗列功能清单不如直接看痛点到方案的对应关系你的痛点Demucs的做法找不到高质量伴奏直接把歌曲拆成人声/鼓/贝斯/其他四轨想留哪轨留哪轨传统消音器残留水声和金属感深度学习认声音同时参考时域和频域信息残留明显更少想要单独提取鼓点做采样--two-stemsdrums一条参数搞定整张专辑要批量处理一次命令行传多个文件自动逐个拆分不想下载动辄几个G的模型提供mdx_q等量化版本体积更小、跑得更快一句话总结以前的工具是减法想办法把某个成分抹掉Demucs是分拣把混在一起的成分按特征捡出来思路不同结果自然不一样。十分钟跑通从安装到拿到四轨文件的一次完整演示理论放一放直接动手。假设你电脑上已经装好了Python 3.8以上的环境。第一步安装Demucs一条命令python3 -m pip install -U demucs如果你更想玩最新源码也可以clone仓库后本地安装git clone https://gitcode.com/gh_mirrors/de/demucs cd demucs pip install -e .第二步随便挑一首你喜欢的歌执行最基础的分离命令demucs 你最爱的歌.mp3首次运行会自动下载默认模型htdemucs之后每次都是本地离线处理。等命令行跑完去当前目录下的separated/htdemucs/你最爱的歌/文件夹看看里面躺着四个文件vocals.wav— 人声drums.wav— 鼓点bass.wav— 贝斯other.wav— 其他伴奏第三步试试两个最常用的玩法。想做卡拉OK伴奏一条命令生成人声伴奏两轨demucs --two-stemsvocals 你最爱的歌.mp3想直接输出MP3、方便扔进手机或剪辑软件demucs --mp3 --mp3-bitrate 320 你最爱的歌.mp3就这样从安装到拿到成品音轨全程不超过一首歌的播放时间。如果你只有CPU也完全能跑处理时长大约是歌曲时长的1.5倍泡杯咖啡等一会儿就好 ☕它内部到底在做什么用三个比方讲明白你不需要读懂模型代码但理解下面几个概念能帮你选对参数、避开大坑。源分离是什么把一首歌想象成一锅什锦汤人声是肉块、鼓是土豆、贝斯是萝卜煮久了全黏在一起。Demucs相当于一位训练有素的厨师他见过无数锅汤能凭纹理和口感把每样食材大致捞回自己的碗里。深度学习模型干的正是认出特征这件事。时域和频域是什么声音有两种记法一种是每个瞬间振幅有多大画出来像心电图一样的波形图另一种是每个瞬间包含哪些频率成分画出来像把彩虹摊开成条的频谱图。老一代分离工具往往只盯其中一种而Demucs v4的混合架构两条都看信息互补所以拆得更干净。Transformer又是什么你可以把它理解成一个特别擅长找全局关联的信息处理模块它能同时看到声音开头和结尾的关系从而判断某段咝咝声到底属于人声还是镲片。Demucs把这种模块架在时域和频域两个分支中间让两边信息互相参考——这就是混合Transformer名字的由来也是v4相比前代最核心的升级。新手常踩的坑五个问答帮你排雷问一运行就提示内存不足或显存爆炸怎么办答加--segment 8把音频切成8秒一段处理显存占用能压到3GB左右。还不行就设置环境变量PYTORCH_NO_CUDA_MEMORY_CACHING1再不行干脆-d cpu用CPU跑。问分离出来的人声有水声或金属感正常吗答输入本身质量差时容易出现伪影。可以换更精细的微调模型-n htdemucs_ft或者在GPU上试试--shifts 4对输入做多次随机偏移预测后取平均质量会明显改善但耗时会成倍增加。问文件名里有空格为什么总是报错答给文件名加上引号例如demucs my favorite song.mp3这是新手最常见的翻车点。问装完以后敲demucs提示找不到命令答如果你是pip install --user安装的可执行脚本可能没进PATH改用python3 -m demucs调用即可。问分离完发现各轨音量忽大忽小答默认设置下Demucs会自动缩放输出以防削波信号过载产生的爆音代价是破坏轨间相对音量。如果你更在意音量一致加--clip-mode clamp让它硬性裁切。玩熟了以后进阶玩法与周边生态用顺手之后你可以按需换模型。htdemucs是默认模型均衡日常使用htdemucs_ft是微调版质量最高但耗时约4倍htdemucs_6s还能多拆出吉他和钢琴两轨钢琴轨目前效果一般慎用mdx_q是量化模型体积小速度快适合低配机器。如果你不想每次敲命令行社区也有不少现成选择有免费的在线分离网站有基于Demucs的图形界面比如知名人声去除软件UVR甚至还有能放进DAW数字音频工作站也就是录音编曲软件的实时插件。对程序员来说Demucs还提供了Python API可以嵌进自己的音频处理流水线import demucs.separate demucs.separate.main([--mp3, --two-stems, vocals, track.mp3])更进一步项目里有完整的训练指南如果你有自己的数据集可以训练出专属于特定风格或特定声音的分离模型——这也是不少研究者和音频公司正在做的事。下一步给你的三条行动建议第一现在就装一个用一首你最熟的歌完整跑一遍亲眼看看四轨分离的效果第二把--two-stems、--segment、-n这几个参数挨个试一遍感受它们对速度和质量的影响第三如果你打算做更复杂的处理翻一翻项目里的API文档和训练文档那里面藏着把Demucs用到极致的方法。工具装好只是起点真正的好玩之处是把拆歌这个能力接进你自己的创作流程里。现在就去试试吧 【免费下载链接】demucsCode for the paper Hybrid Spectrogram and Waveform Source Separation项目地址: https://gitcode.com/gh_mirrors/de/demucs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表