
边说边出字、支持热词、能生成字幕、可接本地大模型——一个真正属于你自己的语音输入法。
导语
写周报写到手酸?开会两小时,整理记录又要两小时?用在线语音输入又担心录音被上传?
如果你也有这些烦恼,今天这篇值得读完。我们要聊的 CapsWriter-Offline,是一个完全本地、离线运行的语音转文字(语音输入/字幕)工具。它不依赖云端、不联网也能用,按住一个键说话,松开文字就"打"进光标位置——真正做到了边说边出字。更重要的是,它开源、免费,模型跑在你自己的电脑上,隐私完全掌握在自己手里。
下面从"它是什么"到"怎么用",手把手带你上手。
① 这是什么 / 能干什么
CapsWriter-Offline 是一个开源的本地语音输入与字幕生成工具。本机部署在 C:CapsWriter-Offline,已安装的组件包括:
- CapsWriter-Offline v2.6 Windows 完整包
- Qwen3-ASR-1.7B(高准确率语音识别模型)
- Qwen3-ForcedAligner-0.6B(给字幕补精确时间轴)
- SenseVoice-Small(轻量快速模型)
- FFmpeg 8.1.2(处理音视频)
它能做三件核心的事:实时语音输入(对着麦克风说话,文字实时上屏)、文件转录(把音频/视频转成文字和字幕)、角色调用(可接本地大模型做润色、翻译、问答)。
② 核心亮点
1. 完全离线、隐私优先 所有识别都在本机完成,不联网、不上云。默认配置里"LLM 后处理总开关"为 False,只做离线语音输入,断网照常工作。
2. 边说边出字 按住快捷键录音,松开即上屏,体验接近"说话即打字"。
3. 双模式,按需切换
- 高准确率模式 Qwen3-ASR:适合正式输入、长句、复杂词句。
- 快速轻量模式 SenseVoice:响应快、占显存少,准确率略低。
4. 热词纠错 专有名词、人名、英文产品名总识别错?在 hot.txt 里加一行即可,修改后自动热重载,不用重启。还能用 hot-rule.txt 做正则规则替换(例如"赫兹 = Hz")。
5. 文件转字幕 把音频/视频拖到程序上,自动产出 .srt 字幕、.txt 文本、.json 时间戳。
③ 使用步骤
第一步:启动 项目根目录有两个"一键启动"脚本,推荐用它们(会自动切模型、结束旧实例再重启):
- 高准确率:
C:CapsWriter-Offline启动-Qwen3-ASR.cmd - 快速轻量:
C:CapsWriter-Offline启动-SenseVoice.cmd
也可以命令行指定模式:
<code class="language-powershell">powershell -NoProfile -ExecutionPolicy Bypass -File C:CapsWriter-Offlinetoolsstart_capswriter_mode.ps1 -ModelType qwen_asr</code>
或把 -ModelType 换成 sensevoice。
第二步:语音输入 默认快捷键(配置在 config_client.py):
- 按住
CapsLock开始录音,松开后识别并输入到当前光标位置; - 或按住鼠标侧键
X2,松开上屏。
想要换成别的键?在 shortcuts 里改 key 即可,可用特殊键包括 space、enter、tab、esc、caps_lock、ctrl_l、shift、alt_l、方向键、f1~f24 等。hold_mode = True 为长按录音,False 为单击开始/再单击停止。
第三步:文件转录 & 字幕 把音频或视频文件直接拖到 C:CapsWriter-Offlinestart_client.exe,支持多文件一起拖。支持的音频格式有 mp3 / wav / flac / ogg / m4a / opus,视频有 mp4 / mkv / mov / avi / flv / wmv。结果保存在原文件同目录,默认生成 .srt、.txt、.json。
第四步:热词设置 打开 C:CapsWriter-Offlinehot.txt,按"每行一个词、| 分隔别名、第一个词是最终替换结果"的格式填写,例如:
<code>Claude | Cloud | 克劳德 hello@example.com | 我的邮箱</code>
说"我的邮箱"就会输入 hello@example.com。
几个常用配置项(均在 config_client.py)
paste = False:默认模拟键盘逐字输入;paste = True改为先写剪贴板再Ctrl+V粘贴(微信、Telegram 等场景更稳)。save_audio = True:自动保存录音,存到C:CapsWriter-Offline年份月份assets,有 FFmpeg 时存为.mp3。language = 'auto':识别语言,auto / chinese / english / japanese / cantonese / korean等可选。llm_enabled = False:默认关闭本地大模型角色;改为True并配置C:CapsWriter-OfflineLLM下的角色文件,可启用润色、翻译、问答。
开机自启(可选):Win + R 输入 shell:startup,把某个 启动-*.cmd 的快捷方式放进去即可(建议只放一个模式)。

④ 适用场景
- 写文档 / 笔记:打开 Word、备忘录,按住键想到啥说啥,长篇内容秒变文字。
- 做字幕:拖入视频自动出
.srt;改完.txt里的错字再拖回去,会根据.json时间戳重新生成字幕,适合二次校对。 - 会议记录:开着录音,会后导出文本,省下大量整理时间。
- 中英混说 / 多语言:Qwen3-ASR 支持中、英、粤、日、韩及德、法、西等 30+ 种语言。
⑤ 结语 + 互动
CapsWriter-Offline 的魅力在于:它把"语音转文字"这件事彻底还给了用户自己——离线、免费、开源、可折腾。无论你是想偷懒少打字,还是介意录音上云,它都值得在电脑里常驻一个位置。
小提示:如果按键没反应,先确认
start_client.exe在运行;若目标程序是管理员权限,客户端也要用管理员权限启动。麦克风用不了时,去 Windows 设置里打开"允许桌面应用访问麦克风"即可。
你平时最想用语音输入解决什么场景?写文档、做字幕,还是会议记录? 欢迎在评论区留言,也欢迎把这篇分享给同样受够码字的朋友~
