
faster-whisper 完整指南用 CTranslate2 把 Whisper 语音转录提速 4 倍【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper会议录音转文字原版 Whisper 慢到打瞌睡显存还动不动爆掉。faster-whisper 用 CTranslate2 重写 Whisper 推理准确率不变速度最高快 4 倍、内存更省8 位量化还能再挤一份性能。它是什么Whisper 换了个推理引擎简单说faster-whisper 是 OpenAI Whisper 模型基于 CTranslate2 推理引擎的重新实现。你熟悉的 Whisper 全尺寸模型——tiny、base、small、medium、large-v1/v2/v3——都能用Distil-Whisper 蒸馏模型distil-large-v2、distil-medium.en 等也直接兼容自己微调过的模型转换后照样能跑。快多少13 分钟音频的实测账单硬件与模型实现方案转录 13 分钟音频耗时最大内存GPU · Tesla V100Slarge-v2openai/whisper4 分 30 秒11325 MBGPU · 同上faster-whisper FP1654 秒4755 MBGPU · 同上faster-whisper INT8—3091 MBCPU · Intel Xeon Gold 6226Rfaster-whisper INT82 分 04 秒995 MB同样这段 13 分钟音频GPU 上 FP16 耗时从 4 分半压到 54 秒显存砍掉一半以上INT8 量化后内存不到 3 GB。没有显卡也没关系CPU 开 INT82 分多跑完内存不到 1 GB。快速上手一条命令 几行代码Python 3.9 及以上版本一条命令装好pip install faster-whisper。之后几行代码就能拿到带时间戳的分段结果from faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})device 改成 cpu、compute_type 改成 int8 就是纯 CPU 跑法info.language 会给出自动检测出的语言及概率。两个高频痛点这样解词级时间戳做字幕对齐或歌词时段级时间戳不够细。transcribe 时加上word_timestampsTrue遍历segment.words就能拿到每个词的起止秒数segments, _ model.transcribe(audio.mp3, word_timestampsTrue)大段静音拖后腿音频里的长静音既拖慢速度又容易诱发幻觉文字。打开内置 VAD 过滤vad_filterTrue即可跳过无声片段默认只滤掉 2 秒以上的静音想更敏感用vad_parametersdict(min_silence_duration_ms500)把阈值降到 500 毫秒。进阶选项GPU 依赖与转换自己的模型想用 GPU需要先装好 NVIDIA 的 cuBLAS 和 cuDNN 库CUDA 12 配套版本按 NVIDIA 官方文档安装即可也可用预装了这些库的 CUDA Docker 镜像图省事。想用自己的微调模型先pip install transformers[torch]4.23再用官方ct2-transformers-converter脚本指定--model与--output_dir加--copy_files tokenizer.json preprocessor_config.json和--quantization float16即得 FP16 的 CTranslate2 模型。产物是本地目录直接WhisperModel(模型目录)加载上传到 Hugging Face Hub 后也能按 用户名/模型名 的方式引用。生态与参与谁在用怎么贡献faster-whisper 已被不少项目选作默认后端faster-whisper-server 提供 OpenAI 兼容的服务器接口WhisperX 靠它实现说话人分离与精确的词级时间戳whisper-ctranslate2 是命令行客户端Open-Lyrics 负责生成 .lrc 歌词文件。项目采用 MIT 协议开源欢迎提 Issue 和 Pull Requestclone 仓库https://gitcode.com/GitHub_Trending/fa/faster-whisper后安装开发依赖pip install -e .[dev]跑pytest tests/即可加入测试与共建。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考