尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

如何用 AutoSub 为多语言视频生成字幕?模型与 Scorer 文件配置完全指南

如何用 AutoSub 为多语言视频生成字幕?模型与 Scorer 文件配置完全指南 如何用 AutoSub 为多语言视频生成字幕模型与 Scorer 文件配置完全指南【免费下载链接】AutoSubA CLI script to generate subtitle files (SRT/VTT/TXT) for any video using either DeepSpeech or Coqui项目地址: https://gitcode.com/gh_mirrors/auto/AutoSub想给外语电影、公开课或纪录片快速加上字幕AutoSub 是一款开源的视频字幕生成工具只需一条命令就能为任意视频自动生成 SRT、VTT、TXT 三种格式的字幕文件。本文是面向新手的 AutoSub 完整配置指南重点讲解模型与 Scorer 文件的下载、放置和指定方法帮你轻松实现多语言视频字幕生成全程无需写一行代码。AutoSub 是什么一条命令搞定视频字幕生成AutoSub 是一个纯命令行CLI的本地字幕生成工具基于开源的语音识别引擎 Coqui STT也兼容 Mozilla DeepSpeech实现。它不需要联网调用云服务所有识别都在你自己的电脑上完成隐私安全、免费不限量。生成的字幕既可以在 VLC、PotPlayer 里直接拖入使用也可以用于剪辑软件或上传视频平台。它的工作流非常清晰步骤做什么涉及模块① 提取音频用 FFmpeg 从视频中提取 16kHz 单声道 WAVautosub/audioProcessing.py② 智能切分按静音段落把长音频切成小片段autosub/segmentAudio.py③ 语音识别对每个片段做推理转成文字autosub/utils.py④ 写出字幕按时间轴生成 SRT / VTT / TXTautosub/writeToFile.py 官方实测约 70 分钟的视频在 i5 双核 8GB 内存的笔记本上大约 40 分钟即可生成字幕速度非常可观。一键安装步骤从零搭好 AutoSub 环境第一步安装依赖AutoSub 依赖 Python 3 和 FFmpeg。先装 FFmpegUbuntu 为例sudo apt-get install ffmpeg ffmpeg -version第二步安装 AutoSub 本体克隆仓库后直接安装即可有 GPU 的同学可以把requirements.txt换成requirements-gpu.txtgit clone https://gitcode.com/gh_mirrors/auto/AutoSub cd AutoSub pip install .第三步下载默认模型文件AutoSub 默认使用英文模型。运行项目根目录下的 getmodels.sh 脚本即可自动下载模型和配套的 Scorer 文件./getmodels.sh 1.0.0执行后会得到两个关键文件模型文件coqui-v1.0.0-english-huge-vocabulary.tflite负责语音转文字的核心神经网络Scorer 文件coqui-v1.0.0-english-huge-vocabulary.scorer语言模型用于提升识别准确率模型与 Scorer 文件配置理解这两个核心概念想配置好多语言字幕必须先搞清楚这两个文件的区别这是模型与 Scorer 文件配置的基础文件类型后缀作用选错/缺失的后果模型文件.tflite/.pbmm语音识别核心引擎决定识别哪种语言无法识别、乱码Scorer 文件.scorer外部语言模型纠正语法、提升准确率识别率明显下降AutoSub 在启动时会自动在项目根目录查找这两种文件如果根目录只有一个模型文件和一个 Scorer会自动加载无需任何参数 ✅如果找不到会自动联网下载默认的英文文件如果存在多个则需要用--model和--scorer参数手动指定详见下文最快的模型检查方法拿不准配置是否正确用--dry-run参数可以只加载模型不处理视频快速验证python3 autosub/main.py --dry-run多语言视频字幕生成更换模型与 Scorer 的完整步骤AutoSub 默认只带英文模型为多语言视频生成字幕时需要手动更换对应语言的模型与 Scorer 文件步骤如下第 1 步下载目标语言模型从 Coqui 官方模型库中找到你想识别的语言如中文、法语、德语、西班牙语等下载对应的.tflite模型文件和.scorer语言模型文件放到 AutoSub 项目根目录。第 2 步用 --model 和 --scorer 指定文件把文件放入根目录后运行命令时显式指定它们以中文模型为例python3 autosub/main.py --file ~/movie.mp4 \ --model zh-CN-model.tflite --scorer zh-CN.scorer⚠️ 注意--model和--scorer支持绝对路径模型放在任意位置都可以通过路径引用非常灵活。第 3 步开始生成字幕命令跑完后字幕文件会保存在项目根目录的output/文件夹中。打开视频播放器如 VLC把 SRT 文件拖进去即可看到字幕 最快出字幕方法常用参数速查表AutoSub 的命令行参数不多掌握下面这几个就能覆盖 90% 的使用场景参数作用示例--file指定要处理的视频--file ~/movie.mp4--format选择输出格式srt/vtt/txt--format srt txt--split-duration单条字幕最长显示秒数默认 5 秒--split-duration 8--model指定模型文件--model zh-CN.tflite--scorer指定 Scorer 文件--scorer zh-CN.scorer--dry-run只加载配置不跑识别--dry-run最小可用命令python3 autosub/main.py --file ~/movie.mp4只生成 SRT 格式python3 autosub/main.py --file ~/movie.mp4 --format srt调整字幕显示节奏觉得字幕切得太碎或太长调整--split-duration即可python3 autosub/main.py --file ~/movie.mp4 --split-duration 8工作原理揭秘AutoSub 如何做到精准对轴AutoSub 能生成和语音精准对轴的字幕秘密在于三步处理流程静音切分先用 FFmpeg 把视频音频提取出来再由 autosub/segmentAudio.py 基于能量分析SVM 分类器识别静音段把大音频切成带时间戳的小片段逐段识别每个小片段都携带着起止时间通过sttWithMetadata()逐段推理出文字和词级时间戳时间轴写入最终由 autosub/main.py 和 autosub/writeToFile.py 把文字按时间戳拼装成标准字幕文件正是这种先切分、再识别、后拼装的设计让生成的字幕天然带有准确的时间轴无需后期手动对齐。常见问题 FAQQ1字幕识别准确率不高怎么办优先检查 Scorer 文件是否与模型匹配。语言模型Scorer对准确率影响极大务必使用与模型同语言、同版本的配套文件。Q2根目录有多个模型文件运行报错AutoSub 检测到多个模型时会要求你明确指定用--model和--scorer参数指出想用哪一套即可。Q3想用 Docker 运行模型文件怎么放Docker 镜像构建时会自动复制项目根目录下的.pbmm和.scorer文件见 Dockerfile所以只需把模型放进根目录再构建镜像即可。Q4视频没有声音怎么办AutoSub 依赖音轨生成字幕无声视频无法处理同时确认系统已安装 FFmpeg。结语AutoSub 把原本复杂的语音识别流程封装成了一条简单的命令而模型与 Scorer 文件配置正是解锁多语言视频字幕生成的关键。看完本文相信你已经掌握了从安装、下载模型到切换语言的完整链路。现在就找一部外语视频试试吧体验一下 40 分钟自动生成整部电影字幕的快感 【免费下载链接】AutoSubA CLI script to generate subtitle files (SRT/VTT/TXT) for any video using either DeepSpeech or Coqui项目地址: https://gitcode.com/gh_mirrors/auto/AutoSub创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表