尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

抠图 + 语音转写:ComfyUI MTB Nodes VitMatte 抠图与 Whisper 音频节点进阶指南

抠图 + 语音转写:ComfyUI MTB Nodes VitMatte 抠图与 Whisper 音频节点进阶指南 抠图 语音转写ComfyUI MTB Nodes VitMatte 抠图与 Whisper 音频节点进阶指南【免费下载链接】comfy_mtbAnimation oriented nodes pack for ComfyUI项目地址: https://gitcode.com/gh_mirrors/co/comfy_mtb本文带你用ComfyUI MTB Nodes一款以动画为核心定位的 ComfyUI 节点扩展包玩转两大实用能力VitMatte 抠图与Whisper 语音转写。前者只需一张粗略掩码就能输出发丝级精细的透明背景抠图结果后者能把任意音频自动转成带时间戳的文本。两个功能都封装成现成节点新手也能快速上手。一、这套功能能做什么场景用到的节点效果人像抠图、商品抠图VitMatte 三件套输出 RGBA 透明图 精细 MASK音频转字幕、口播转文字Whisper 转写节点全文文本 分段时间戳多人对话音频说话人分离节点自动标注 SPEAKER支持单独提取某人声音剪辑素材音频切割 / 拼接 / 叠加节点按毫秒精确切割、拼接、混音二、VitMatte 抠图三个节点搞定发丝级抠图VitMatte 是基于视觉 Transformer 的精细抠图模型核心思路是你给一个粗略掩码Mask节点自动生成三值图trimap再由模型推断精确边缘。第 1 步MTB_LoadVitMatteModel 加载模型选择模型种类Composition-1K构图场景或Distinctions-646边缘区分场景autodownload默认开启首次运行会自动把模型下载到本地models/vitmatte/目录⚠️ 该模型强制使用CUDA需要 GPU 环境第 2 步MTB_GenerateTrimap 生成三值图输入你手头任何来源的 MASK比如 SAM 分割、手工绘制调整两个关键参数erode腐蚀默认 10确定肯定前景区域数值越大前景核心越保守dilate膨胀默认 10确定肯定背景区域与 erode 的差值就是模型需要精修的边缘带 技巧erode 与 dilate 差值越大边缘过渡带越宽越适合发丝、毛发等复杂边缘。第 3 步MTB_ApplyVitMatte 应用抠图输入模型 IMAGE trimap输出image (rgba)抠图结果图。returns选RGBA得到带透明通道的完整图像选RGB只得到去背景后的前景图mask模型生成的精细蒙版可直接接后续合成、遮罩节点典型工作流加载模型 → 粗略 Mask 生成 Trimap → 应用 VitMatte → 输出 RGBA 透明图整条链路在 ComfyUI 画布上只需 3 个节点。源码实现可参考nodes/vitmatte.py。三、Whisper 语音转写从声音到带时间戳的文本MTB_LoadWhisper 加载模型Whisper 模型尺寸一览按需选择尺寸特点适用tiny最快、最省显存快速试跑、低配机器base / small速度质量平衡日常使用medium / medium.en质量更高精细转写large-v3 / large-v3-turbo精度最高专业场景模型存放位置ComfyUI/models/whisper/whisper-{尺寸}/download_missing开启后可自动下载缺失模型无需手动搬运文件MTB_AudioToText 执行转写支持语言自动检测language选auto也支持指定中文、英文、日语等 11 种语言return_timestamps默认开启输出带时间戳的完整文本长音频内部自动按 30 秒分块处理逐块转写后拼接不会一次爆显存MTB_ProcessWhisperOutput 切分时间戳把转写结果按时间戳切成一个个文本块chunks每块包含文本内容和起止时间min_chunk_length过滤掉过短的片段避免字幕碎片化输出的WHISPER_CHUNKS可直接用于字幕生成、说话人分离等下游节点四、进阶玩法说话人分离与音频编辑多人对话自动分人MTB_ProcessWhisperDiarization支持pyannote和nemo两种后端设置num_speakers说话人数量1~10后自动为每个文本块标注SPEAKER_00、SPEAKER_01MTB_AudioIsolateSpeaker根据标注结果只保留指定说话人的声音isolate或静音该说话人mutefade_ms参数防止切割产生爆音这套组合非常适合做访谈剪辑、播客素材分离。实用音频小工具节点功能MTB_AudioCut按毫秒精确切割音频length offsetMTB_AudioSequence多段音频顺序拼接支持插入静音或负值重叠MTB_AudioStack多路音频叠加混音自动对齐采样率MTB_AudioResample重采样Whisper 要求 16000Hz可提前转好MTB_AudioDuration获取音频时长毫秒便于做条件判断所有音频节点实现见nodes/audio.py抠图实现见nodes/vitmatte.py。五、新手避坑清单 ✅VitMatte 必须有 NVIDIA GPU模型加载阶段强制.to(cuda)纯 CPU 环境无法运行Whisper 模型下载失败手动开启节点里的download_missing或确认ComfyUI/models/whisper目录可写转写不准优先换medium及以上模型长音频已自动分块无需人工切割音频采样率非 16kHz 的音频会自动重采样一般无需干预安装方式推荐用 ComfyUI Manager 安装本扩展包额外模型可运行python scripts/download_models.py -y一键下载参考INSTALL.md六、总结MTB Nodes 把VitMatte 抠图和Whisper 语音转写这两项 AI 能力封装成了直观拖拽即可使用的 ComfyUI 节点抠图侧只需三个节点就能输出发丝级透明背景音频侧从转写、切分到说话人分离形成完整闭环。无论是做视频合成还是播客后期这套组合都能显著提升你的工作流效率。【免费下载链接】comfy_mtbAnimation oriented nodes pack for ComfyUI项目地址: https://gitcode.com/gh_mirrors/co/comfy_mtb创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表