
完全离线的语音转文字神器 Handy5分钟上手开口就能成文【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy灵感来了打字跟不上、会议开了两小时笔记只有三行——这种时刻你最需要的是一款能听你说话的语音转文字工具。可惜市面上的语音转文字应用大多要联网、要注册、要付费声音还得送去云端转一圈。Handy 是一款完全离线的开源语音转文字工具按一下快捷键开口说话松手文字就自动出现在你正在用的任何输入框里所有识别都在你电脑本地完成一个字都不会外传。本地转录和云端转录到底差在哪一步用过在线转录的朋友应该都熟悉这套流程上传录音、排队等待、下载文本运气不好还要交月费遇到网络不稳、或者内容涉及保密的时候更是提心吊胆。Handy 的玩法完全相反它的工作流只有四步按下你自定义的快捷键开始录音 → 开口说话 → 松手停止 → 文字自动粘贴到当前光标位置。全程没有上传这个动作。它用 Silero 做语音活动检测VAD先把静音段过滤掉只保留真正有内容的语音片段再交给本地的识别模型处理。说人话就是安静时它不浪费算力你一开口它立刻开工。对隐私敏感的人来说这意味着会议纪要、病例口述、还没公开的稿件都可以放心说出口因为它们从没离开过你的电脑。5分钟跑通说话打字从下载到说出第一句话上手真的不需要研究手册三步就能跑通。第一步装一个。直接到官网下载对应系统的安装包即可。macOS 用户可以在终端执行brew install --cask handyWindows 用户用winget install cjpais.Handy装完就是最新版。第二步授权。首次启动会弹出两个系统权限请求麦克风权限用来录音和辅助功能权限让 Handy 能把文字敲进其他应用。两个都允许别犹豫。第三步配快捷键然后说话。在设置里把开始/停止录音的全局快捷键设成你顺手的组合比如 CtrlShiftSpace也可以打开 Push-to-talk 模式按住说话、松开即停。回到任意一个输入框按下快捷键说一句你好世界松手——文字已经躺在那里了。整个过程不需要切换窗口、不需要复制粘贴、更不需要等云端排队。本地模型怎么挑Whisper、Parakeet 与流式转录Handy 最让我惊喜的一点是把选模型做成了自助餐。打开设置里的 Models 页面你可以按需更换识别引擎Whisper 系列Small 轻快适合日常Medium 速度与准确率平衡Turbo 响应快Large 准确率最高适合专业场景。支持 GPU 加速显卡够好就开。Parakeet V3专为 CPU 优化没有独显的机器也能流畅跑还自带自动语言检测说哪种语言都行。0.9.0 版本之后底层换上了更快的 transcribe.cpp 引擎最大的变化是支持流式模型边说边出字而不是等你说完一整段才蹦出结果。新引擎还解锁了一大批新模型家族——IBM 的 Granite、Mistral 的 Voxtral、Google 的 MedASR、阿里的 Qwen3 ASR都能在 Models 页面里找到。默认情况下使用流式模型时会显示一个实时字幕浮层你看着自己说的话一个字一个字变成文字这种即时反馈对长句口述特别友好不习惯这个浮层高级设置里一键就能切换回极简样式。让转录结果更懂你三个值得花两分钟的设置模型选对之后转录质量还能再上一层楼以下三个设置强烈建议花两分钟调一调自定义词汇表做医疗、法律、编程这类专业领域时把术语加进词汇表识别准确率立竿见影入口在设置中的 Custom Words 项。去填充词口述时总免不了嗯那个然后打开填充词移除Filler Word Removal转录结果会干净很多适合直接发出去的正式文本。后处理与翻译Handy 支持接入后处理 API自带 Prompt 模板配置还能一键把转录结果翻译成英文跨语言记录灵感时非常省事。这些设置模块的代码都在 src/components/settings/ 目录下想了解每个选项是怎么实现的直接翻源码即可。给好奇的人它凭什么又快又离线如果你对技术实现感兴趣Handy 的架构相当清爽Tauri 框架 React/TypeScript 前端 Rust 后端。UI 部分在 src/components/核心处理逻辑录音、VAD、模型推理、快捷键、文本粘贴都在 src-tauri/src/ 里代码完全开放。项目官方甚至说过一句很酷的话它不想做最好的语音转文字应用只想做最容易被改造成自己的那一款。进阶玩家还可以用命令行远程操控比如handy --toggle-transcription可以在不碰界面的情况下切换录音handy --start-hidden --no-tray则适合开机自启的场景。想从源码跑起来也很简单git clone https://gitcode.com/GitHub_Trending/handy11/Handy cd Handy npm install npm run tauri dev说点大实话Handy 也有小脾气诚实一点Handy 还处在活跃开发期有几个已知限制值得提前知道macOS 上使用蓝牙耳机麦克风录音时可能会临时影响播放音质蓝牙切到了双向音频建议耳机只当输出设备用内置或外接麦克风收音带 fn地球键的快捷键只在 Apple 键盘上生效第三方键盘受硬件限制永远不会触发Whisper 模型在部分 Windows/Linux 配置上会崩溃官方正在招募开发者帮忙排查Linux 的 Wayland 支持有限需要额外安装 wtype 或 dotool 才能正确输入文字。这些都是文档里明明白白写出来的老实交代对多数用户影响不大但提前知道总比踩坑强。最后一句回到开头那个场景灵感、会议、被占满的双手。Handy 想解决的从来不只是识别准不准这一个问题而是语音输入这件事能不能像呼吸一样自然。它免费、开源、完全离线下载之后 5 分钟就能让电脑听懂你说话。如果你也受够了云端转录的等待和隐私焦虑不妨现在就下载试试然后按下快捷键说出你的第一句话。你会发现打字这件事可能真的要成为过去式了。【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考