
PyVideoTrans 完整指南3 个命令跑通视频翻译与 AI 配音【免费下载链接】pyvideotransTranslate the video from one language to another and embed dubbing subtitles.项目地址: https://gitcode.com/gh_mirrors/py/pyvideotransPyVideoTrans 是一款开源的视频翻译工具能把视频里的语音识别成字幕、翻译成目标语言、用 AI 配音替换原声再把音画合成一个新视频。整套流程可以一键跑完也能在每个阶段停下来人工校对。下面按先跑通、再懂原理、最后挑引擎的顺序带你上手。先跑起来三步拿到第一条结果Windows 用户最省事的路径是预打包版从项目仓库下载最新版本压缩包解压到不含中文和空格的路径比如D:\pyVideoTrans双击文件夹里的sp.exe启动如果你是开发者或者在 macOS / Linux 上用源码部署更灵活需要 Python 3.10 和 FFmpeg 已装好git clone https://gitcode.com/gh_mirrors/py/pyvideotrans cd pyvideotrans uv sync uv run sp.py图形界面打开后翻译一个视频只需要三个动作选视频文件并确认源语言 → 选目标语言和翻译渠道 → 选配音引擎和音色点击开始。不想点界面也可以直接走命令行一条命令出结果uv run cli.py --task vtv --name ./video.mp4 --source_language_code zh-cn --target_language_code en --voice_role en-US-GuyNeural小贴士CLI 全部参数在 docs/cli.md 里--task还支持stt转字幕、sts翻译字幕文件、tts文字转语音三种模式。它内部是怎么把整条流水线串起来的很多人跑完之后会好奇中间到底发生了什么答案是一条9 个阶段的流水线预处理从视频里拆出无声画面流和原始音频可选人声/背景分离、降噪语音识别ASR 引擎把音频转成带时间戳的 SRT 字幕说话人分离把字幕按发言人标注归类字幕翻译整份 SRT 翻译成目标语言配音逐条调用 TTS 引擎生成配音音频音画对齐通过变速、去静音让配音长度贴合原片时间轴二次识别对配音音频再识别一遍修正字幕时间轴最终合成ffmpeg 把画面、配音、字幕合成终稿收尾文件移到输出目录、清理临时缓存架构上用的是生产者-消费者模式一个生产者线程把任务推入队列9 类专职 Worker 各监听自己的队列并行消费。同时有 5 个布尔开关是否识别、是否翻译、是否配音、是否合并、是否分离人声自动决定跳过哪些阶段——所以你用它视频转字幕或只翻译字幕文件时流水线会自动裁剪而不是硬跑全流程。任务基类在 videotrans/task/ 目录细节可以看 docs/architecture.md。按你的场景挑一套组合功能多不等于乱配。按任务选组合比逐个功能研究快得多教学或知识类视频推荐Faster-Whisper本地识别 DeepSeek翻译 Edge-TTS配音。Whisper 本地跑速度准头都好DeepSeek 的 LLM 翻译对术语句式的处理比传统机翻自然Edge-TTS 完全免费。整套基本零成本。影视剧翻配推荐WhisperX 或阿里 Qwen识别 ChatGPT/DeepSeek翻译 F5-TTS 或 CosyVoice配音开声音克隆。影视里角色对白多给每个角色克隆一个固定音色观感会明显比一个声音到底好。会议录音转写打开说话人分离内置 / pyannote 等后端让工具先把发言人的话分开标注再为每个发言人分配不同配音音色转出来的纪要能直接看出是谁在说什么。批量处理短视频图形界面不适合几百个文件时用 CLI 批处理uv run cli.py --task vtv --name ./videos/*.mp4 --source_language_code zh --target_language_code en引擎怎么选才不踩空项目内置了22 种识别引擎、24 种翻译渠道、34 种 TTS 引擎。新手记住四条选型原则就够识别优先本地Faster-Whisper、WhisperX中文内容可加测阿里 Qwen翻译看内容技术文档用 Google/Microsoft 这类传统机翻又快又稳文学、创意内容上 DeepSeek、ChatGPT 这类 LLM配音预算有限就 Edge-TTS要个性化音色就上支持克隆的 F5-TTS / CosyVoice / GPT-SoVITS数据敏感就全本地Ollama M2M100 翻译加本地 Whisper 识别完全离线可跑你要解决的问题直接选它理由英文语音识别Faster-Whisper本地、快、准中文语音识别阿里 Qwen中文场景准确率高高质量免费翻译DeepSeek效果接近人工免费配音Edge-TTS零成本效果自然声音克隆F5-TTS / CosyVoice一段样本即可克隆完全离线Ollama M2M100数据不出本机避坑、调优与加速按踩坑频率从高到低排路径含中文或空格解压目录和视频文件路径都别用中文这是头号报错源。FFmpeg 没配好源码部署必须装 FFmpeg 并加入环境变量Windows 也可把ffmpeg.exe、ffprobe.exe直接放进项目目录。背景音嘈杂预处理阶段开降噪开关识别率会稳不少。字幕断句碎、标点乱识别阶段可以开标点恢复和LLM 重新断句两个选项识别参数在 videotrans/component/onlyone_set_recogn.py 里能看到对应配置项。克隆音色效果差参考音频用 5~10 秒清晰、无背景音的人声片段杂音会直接被克隆进去。本地模型太慢有 NVIDIA 显卡就换 CUDA 版 PyTorch需 CUDA 12.8 / cuDNN 9.11 环境uv remove torch torchaudio uv add torch2.7 torchaudio2.7 --index-url https://download.pytorch.org/whl/cu128 uv add nvidia-cublas-cu12 nvidia-cudnn-cu12跑一半想检查识别、翻译、配音三个阶段都支持暂停并打开人工校对窗口改完再继续比重跑整条流水线省时间。更多报错对照见 docs/faq.md。想再深一层扩展与自定义项目把三类引擎各自拆成独立目录接新引擎基本是抄作业新识别引擎 → 在 videotrans/recognition/ 加一个模块继承基类实现识别接口新翻译渠道 → videotrans/translator/同样模式新 TTS → videotrans/tts/实现生成接口后注册即可每个目录里都有_base.py定义统一接口照现有引擎抄一份改参数就行不用动流水线。想部署成服务的话webui.py提供浏览器界面uv sync --extra webui后运行仓库根目录的 Dockerfile 则支持一条命令容器化跑 WebUI。到这里你手里已经有一条能完整跑通的识别 → 翻译 → 配音 → 合成流水线外加一套按场景取用的引擎组合。挑一个手头最真实的视频文件用上面的三步把它翻成另一种语言跑完第一个你就知道接下来往哪调了。【免费下载链接】pyvideotransTranslate the video from one language to another and embed dubbing subtitles.项目地址: https://gitcode.com/gh_mirrors/py/pyvideotrans创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考