
离线语音转文字实测24 种语言、5 倍实时速度Handy 凭什么断网也能出字【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy飞机刚进入平飞我对着笔记本口述了一整段采访提纲。降落时打开备忘录那段话已经整整齐齐躺在里面——全程没连过一次网。让说话自动变成文字脱离云端的是一款叫 Handy 的开源桌面应用完全离线的语音转文字录音、识别、文本生成全部在本机完成。它为什么敢断网干活普通人又该怎么把它用起来这篇笔记按原理—上手—亮点—场景的顺序拆给你看。它怎么在断网时听懂人话的 ️很多人第一次听到离线语音识别会下意识以为是个缩水版。其实 Handy 的思路恰恰相反它把整套识别引擎搬进了你的电脑而不是从云端借算力。流程很短按下快捷键开始录音 → 说话 → 松手 → 文字自动出现在光标所在的位置。其中有两个细节值得单独拎出来静音是剪掉的。录音过程中Silero 语音活动检测VAD会实时判断哪些片段是有效语音把停顿、吸气、背景噪声滤掉交给识别器的都是干货既省算力也省时间。模型是可以选的。默认提供 Whisper 家族Small / Medium / Turbo / Large有 GPU 时自动加速另有一个专为 CPU 优化的 Parakeet V3最低只需要 6 代酷睿官方在 i5 上测出约 5 倍实时速度还自带自动语言检测——不用手动指定语种。0.9.0 版本之后主引擎换成了 transcribe.cpp最直观的变化是支持流式模型像 Parakeet Unified面向英语、Nemotron Streaming 3.5面向多语言这类模型文字会随着你的语速边读边出而不是等一句话说完才整体蹦出来。⚡从装好到第一次出字大概一首歌的时间上手不需要动代码。装好后给它麦克风权限和辅助功能权限设一个顺手的快捷键第一次录音时它会提示下载模型之后就进入了按一下、说一句、出字的循环。macOSbrew install --cask handyWindowswinget install cjpais.Handy其他平台从发布页下载对应系统的安装包想从源码构建也不难环境准备好后几条命令即可git clone https://gitcode.com/GitHub_Trending/handy11/Handy cd Handy npm install npm run tauri dev如果你习惯命令行它还暴露了一组远程控制参数--toggle-transcription开关录音、--cancel取消当前操作、--start-hidden静默启动。这些参数在 Wayland 桌面环境里尤其好用——系统快捷键没法直接联动应用时把快捷键指向这条命令就行。调试模式也随时可用macOS 按CmdShiftDWindows/Linux 按CtrlShiftD里面能看到完整日志和路径信息。那些把能用变成好用的开关 默认配置已经能干活但 Handy 的真正乐趣藏在设置里。src/components/settings/目录下挂着几十个开关挑几个我日常用得最多的流式覆盖层。用流式模型时屏幕角落会出现一个半透明小窗你正在说的话实时变成文字显示在上面边说边确认说错了当场改口重说。Push-to-talk 模式。按住快捷键说话、松开即停适合不想让录音一直挂着的人配合音频反馈音能清楚判断当前是否在录。自定义词汇表。专业术语、人名、产品名反复识别错在自定义词汇里加进去之后命中率明显提升。转录文本还能做后处理过滤嗯那个这类填充词、补上标点、甚至接入 OpenAI 兼容接口自定义 Base URL 加 API KeymacOS 上还能用 Apple Intelligence让文字更通顺。多语言与多模型。界面和识别一起覆盖 24 种语言阿拉伯语、希伯来语这类从右往左的文字也做了适配。除了内置模型把社区训练好的 Whisper GGML 模型丢进数据目录的models文件夹重启后就会出现在自定义模型里——扩展性这件事它是认真的。真实场景把一场评审会说成纪要 每周五的产品评审会我现在的做法是开着 Handy用 Push-to-talk 在自己发言时按住快捷键别人说话时松开。散会后我口述一段今天的结论是……几秒钟内就能得到一份结构化的纪要草稿稍作整理就能发出去。手不用离开桌面眼睛也不用在窗口之间来回跳。对打字困难或视力障碍的用户这个说话即输入的能力价值更大——它本质上是一条不依赖键盘的输入通道而且所有识别都在本地完成敏感内容不会经过任何服务器这也正是它把离线当卖点而非妥协的原因。踩坑清单提前替你填平的几个坑 ⚠️麦克风没声音先查系统隐私设置里的麦克风权限再确认没有其他应用独占设备。识别率不理想换更大的模型试试排查环境噪音如果专业词多先更新自定义词汇表。Linux 上文字粘贴不进去X11 装xdotoolWayland 装wtype或dotool这是文本输入的底层依赖README 里有完整的对照表和配置说明。网络受限、模型下载不了直接用浏览器下载模型文件手动放进数据目录的models文件夹重启即可识别目录结构和命名规则见 README.md 的 Troubleshooting 一节。macOS 蓝牙耳机录音时音质下降这是蓝牙双向音频的固有限制输出保持耳机、输入改用 Mac 内置麦克风即可。它不是最强的却是最容易被 fork 的Handy 的自我定位很有意思项目 README 里写得很直白它没打算做最好的语音转文本应用而是想做最容易被 fork 的那一个。代码基于 MIT 协议开源前端是 React TypeScript后端是 RustTauri 框架核心处理逻辑集中在src-tauri/src/——想自己加功能、换模型、接插件都有清晰的下手点。社区也已经为它做了 Raycast 扩展能在启动器里直接开关录音、翻转录历史。下次你需要把话变成字又不想让任何一句私密内容离开电脑时不妨试试它。先装好再花几分钟调一调快捷键和模型然后你就会发现断网从来不是语音输入的天花板。【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考