尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

用Faster Whisper做语音转文字:语音识别工具完整安装教程

用Faster Whisper做语音转文字:语音识别工具完整安装教程 用Faster Whisper做语音转文字语音识别工具完整安装教程【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 是一款基于 CTranslate2 重写的语音转文字工具它复用 Whisper 模型权重推理速度比原始实现快约 4 倍识别准确率与原版持平支持 99 种语言。⚡ 三分钟上手faster-whisper 安装命令与首次转录先确认你的环境满足下面三行要求检查项要求Python 版本3.8 及以上操作系统Linux / Windows / macOSGPU可选NVIDIA 显卡CUDA 11.0性能最佳git clone https://gitcode.com/GitHub_Trending/fa/faster-whisper cd faster-whisper pip install -r requirements.txt音频解码由内置的 PyAV 完成你不需要单独安装 FFmpeg。项目同时提供 Python API 和命令行工具想跑基准测试的话再补一句pip install -r benchmark/requirements.benchmark.txt。接着运行最短的转录脚本from faster_whisper import WhisperModel model WhisperModel(base, deviceauto, compute_typeint8) segments, info model.transcribe(audio.mp3, languagezh) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})注意segments是生成器只有迭代它时转录才真正开始想立即跑完就包一层list(segments)。whisper 模型怎么选档位、计算类型与参考数据项目提供 5 个模型档位按“速度—精度—资源占用”三者取平衡即可表中附带 RTX 3090 上的参考数据档位定位参考速度RTX 3090参考显存tiny速度优先低资源设备可用——base速度与精度兼顾约 40 倍实时约 1GBsmall精度更高多数场景适用——medium面向专业用途的高精度——large最高精度关键任务用约 10 倍实时约 6GB计算类型主要看两点compute_typeint8是 8 位量化CPU 上能显著压低内存占用compute_typefloat16需要 NVIDIA GPU精度表现更好。有多块显卡时给device_index传一个列表即可让多 GPU 并行分摊任务。两个常用开关值得知道vad_filterTrue会启用内置 Silero VAD先把音频里的静音段滤掉再转录长录音能省不少算力vad_parameters里的min_silence_duration_ms可调静音判定阈值word_timestampsTrue则让每个词都带起止时间做字幕对齐和逐词高亮都用得上。三个高频场景批量转录、whisper 转 SRT 字幕、实时转录整目录批量转录几十段会议录音要一次出文字稿时不必写复杂流水线命令行套个循环即可for f in audio_files/*.mp3; do python -m faster_whisper transcribe $f --model small --output_dir ./transcripts done音频特别长的话可以在transcribe里传chunk_length让它分块处理避免单段排队太久。whisper 转 SRT 字幕给视频配字幕是典型需求加两个参数就能导出标准字幕文件python -m faster_whisper transcribe video_audio.mp3 \ --model small --output_format srt --output_dir ./subtitles输出的.srt含序号、起止时间和文本三段可直接拖进剪辑软件使用。麦克风实时转录配合sounddevice以 16kHz 单声道抓麦克风数据每次回调送进模型并即时打印import sounddevice as sd from faster_whisper import WhisperModel model WhisperModel(base, deviceauto, compute_typeint8) def callback(indata, frames, t, status): segments, _ model.transcribe(indata.T, languagezh) for seg in segments: print(seg.text, end, flushTrue) sd.InputStream(samplerate16000, channels1, callbackcallback).__enter__()这是演示级做法追求更低延迟可以看社区里的流式方案。避坑手册三个常见问题的现象、原因与做法模型下载慢现象第一次用模型名初始化进度条长时间不动。原因对应的 CTranslate2 权重会从 Hugging Face Hub 自动拉取速度取决于你的网络。做法提前把模型文件下到本地改用路径加载WhisperModel(/path/to/local/model, deviceauto)。CPU 还是 GPU参数怎么填现象device和compute_type不知道该配什么。原因量化类型与硬件匹配度决定性能int8 省内存float16 吃 GPU 算力。做法CPU 上用compute_typeint8并把cpu_threads8之类的线程数调大GPU 上写devicecuda搭配compute_typefloat16。中英混合音频识别不准现象中英夹杂的讲座或会议录音输出混乱。原因强制指定了单一语言或模型缺少主题上下文。做法不传language参数交给模型自动检测再给initial_prompt喂一句主题描述比如initial_prompt这是一段中英夹杂的产品演示视频解说。结语faster-whisper 把“速度、精度、内存”三件事交给了模型档位和计算类型两个旋钮参数并不多但每一档都有明确的取舍。仓库里源码在 faster_whisper/速度、内存基准脚本在 benchmark/ 下的speed_benchmark.py和memory_benchmark.py测试用例在 tests/。现在就 clone 下来用 base 模型跑一段一分钟的语音备忘感受下 4 倍的差距。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表