
10 分钟跑通 whisper.cpp 本地语音转写【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp读完这篇文章你能在自己电脑上把一段音频离线转成带时间戳的文字全程不上传云端。whisper.cpp 是 OpenAI Whisper 模型的 C/C 移植版解决的是语音转文字不想走云服务这个问题核心卖点纯本地推理、模型支持量化压缩、覆盖 99 种以上语言编译后一条命令出结果。核心能力速览whisper.cpp 能做什么、不能做什么它做的事把 16-bit WAV 音频转成文字支持时间戳输出txt / srt / vtt和翻译成英文全程离线音频不出机器。它不做的事不直接读 mp3 / ogg先用 ffmpeg 转成 WAV也不做说话人分离识别结果以段segment为单位不逐字对齐。关键指标数值模型档位tiny ~ large-v3-turbo磁盘 75 MiB 到 2.9 GiB最小内存占用tiny 模型约 273 MB可再用量化的-q5_1版本支持平台Windows / macOS / Linux / Android / iOSCPU 可跑有 CUDA、Metal 等后端30 秒跑通第一条离线识别结果先拿到源码并进入目录# 克隆仓库 git clone https://gitcode.com/GitHub_Trending/wh/whisper.cpp cd whisper.cpp接下来下载模型并编译。base.en是英语单语模型142 MiB多语言需求选不带.en的base--config Release是发布模式编译更快、推理更快# 下载 ggml 格式的 base.en 模型 sh ./models/download-ggml-model.sh base.en # 配置并编译Release 模式 cmake -B build cmake --build build --config Release最后跑仓库自带的示例音频samples/jfk.wav识别结果会直接打印在终端./build/bin/whisper-cli -m models/ggml-base.en.bin -f samples/jfk.wav几秒到几十秒取决于机器后你会看到 And so, my fellow Americans... 这段讲话的文字。⚠️ Windows 用户编译命令不变CMake 里选 Visual Studio 生成器即可运行时把路径写成build\bin\whisper-cli.exe。一张表选对 whisper 模型模型名体积磁盘 / 内存速度感精度档位一句话建议tiny75 MiB / ~273 MB⚡⚡⚡ 最快基础树莓派、低配机先验证流程base(.en)142 MiB / ~388 MB⚡⚡ 快良好新手默认small466 MiB / ~852 MB⚡ 中等优秀正式转写的主力medium1.5 GiB / ~2.1 GB较慢极佳精度优先、资源充足large2.9 GiB / ~3.9 GB慢极佳追求极限精度时再考虑英语素材默认base.en、混合语言默认base带.en后缀的模型只认英语速度略快。对 base 的错词不满意、且转写是主业时升级到 small真正需要高精度再考虑 medium / large。内存紧张就直接下量化版如sh ./models/download-ggml-model.sh base.en-q5_1磁盘和内存占用能省约三分之一。三个真实工作流批量、实时、指定语种长音频批量转写 时间戳对齐把两小时会议录音16-bit WAV交给下面命令-osrt让它按段输出字幕文件./build/bin/whisper-cli -m models/ggml-small.bin -f meeting.wav -osrt回车后等几分钟同目录下会生成带时间码的meeting.srt可直接拖进播放器当字幕用同一批文件写个循环跑-otxt就能得到纯文本稿。麦克风实时转写运行./build/bin/whisper-stream -m models/ggml-base.en.bin -t 8 --step 500 --length 5000对麦克风说话它每 0.5 秒采样一次并持续输出识别块该示例依赖 SDL2装法见下节。指定语种识别中文录音用不带.en的模型加-l zh锁定语种whisper-cli -m models/ggml-small.bin -f interview.wav -l zh不确定语种就加-dl让它先自动检测再转写。踩坑速查4 个高频问题编译报错提示找不到 CMake 或编译工具原因系统缺 C/C 工具链。修复Debian/Ubuntu 执行sudo apt-get install build-essential cmakemacOS 先装 Xcode 命令行工具xcode-select --install。模型下载慢或中途失败原因下载脚本从海外 Hugging Face 源拉取文件。修复重试或手动拿到ggml-模型名.bin后放进models/目录即可命令行参数不受影响。中文识别很差或输出全是英文原因用了.en英语单语模型它会忽略-l参数。修复换不带后缀的模型如models/ggml-base.bin并加-l zh。内存不足、进程被系统杀掉原因模型档位超过机器内存。修复降一档small 换 base或改用量化版sh ./models/download-ggml-model.sh base.en-q5_1内存占用明显下降。往哪里接绑定与扩展核心是 include/whisper.h 暴露的 C API仓库自带 bindings/go、bindings/java、bindings/javascript、bindings/ruby 四套官方绑定。最常用的接入点是 examples/server编译后它是一个 HTTP 转写服务接口风格对齐 OpenAI 的 transcription API把现有脚本里的转写地址改成指向本地的whisper-server就是一条现成的离线转写服务线。收尾现在你手里有一条不依赖云端的转写链路clone、下一个模型、一条命令出结果。下一步的具体动作下载small多语言模型转一段你自己的中文录音和base.en的结果对比差距。如果机器富余把examples/server编译起来挂到内网让整支团队共用这一份离线算力。【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考