完全开源
MIT 许可。协议、纠错算法、界面——每一行代码都可读、可改、可自部署。
按住 右 Ctrl 说话、松开,文字直接落到任意应用的光标处。识别默认在你自己的电脑上完成;识别引擎、AI 润色和热词词典都由你自己掌控。
Windows 10/11 x64 · macOS 预览版(Apple 芯片) · 更新说明与历史版本
大多数 AI 语音输入是闭源的,你的声音要经过厂商服务器。SpeakType 没有服务器——音频只去你指定的地方,或者哪儿都不去。
MIT 许可。协议、纠错算法、界面——每一行代码都可读、可改、可自部署。
识别默认在你的电脑上完成。只有当你配置了云端引擎,音频才会发出去——而且只发到那个地址。
落字后手动改掉一个错词,SpeakType 会把 {错 → 对} 学进你的词典。同一个错误,不会犯第二次。
按一下 Alt+Q 或双击热键进入。按静音自动断句,停顿更久自动分段,随时 Esc 取消。可选语音命令。
选中一段文字,按住 F8 说“翻译成英文”或“改正式一点”——选区原地被替换。中途切了窗口?结果会留在剪贴板等你。
Alt+1…9 切换风格——默认、自动翻译、汇报老板、命令行、你自己的提示词——也可以按前台应用自动切换。
电脑没麦克风?扫码后对着手机说。局域网直连,或走一个可自部署的中转。
拖入音频或视频(mp3、wav、m4a、mp4…最长 3 小时),离线分段转写带时间轴,导出 TXT、SRT 或 VTT。
运行安装包,或解压绿色版——它把配置放在 .exe 旁边。
设置 → 语音 → 内置离线模型(一键下载),或者填入你自己的 API Key。
光标放到任意位置,按住 右 Ctrl(或鼠标侧键),说完松开。
手动改一个词,它就自动进词典——准确率随使用累积。
在应用内下载一次模型,之后永远离线——或者把 SpeakType 指向任意 OpenAI 兼容接口。随时切换。
| 模型 | 大小 | 适合 | 说明 |
|---|---|---|---|
| SenseVoice Small默认 | 240 MB | 中文、粤语、日语、韩语、英语 | 实测每句纯识别约 0.27 秒(端到端约 0.6 秒),自带标点 |
| Parakeet TDT 0.6B v3int8 | 670 MB | 英语 + 25 种欧洲语言 | 英文准确率最高;int8 偶尔会吞掉句首第一个词 |
| Parakeet 全精度fp32 · 可选 | 2.5 GB | 与 Parakeet 相同 | 修复句首吞词;加载后约占 2.7 GB 内存,实测速度与 int8 相同 |
| Whisper tiny / base / smallwhisper.cpp · 仅 Windows | 32 / 60 / 190 MB | 语言覆盖最广 | tiny 最快但易错;small 最慢也最准 |
左右滑动查看完整表格
/audio/transcriptions实时跟随系统主题。下面每一张都是 Windows 版的真实截图(英文界面;应用本身可切换简体中文)。




在设置里扫一下二维码,按住手机上的按钮说话。文字落到电脑光标处,和本地录音完全一样。
对比大家通常会用的闭源语音输入工具。
| SpeakType | 典型 AI 语音输入 | 系统自带听写 | |
|---|---|---|---|
| 源代码 | 开源(MIT) | 闭源 | 闭源 |
| 完全离线可用 | 是——4 档本地模型 | 通常仅云端 | 部分 |
| 音频去哪儿 | 不出本机,或你指定的接口 | 厂商服务器 | 厂商服务器 |
| 自带引擎 / Key | 支持 | 不支持 | 不支持 |
| 从修改中自学纠错 | 自动 | 手动词典 | 无 |
| 免按听写 & 选中改写 | 支持 | 不一定 | 有限 |
| 手机当麦克风 | 支持 | 无 | 无 |
| 价格 | 免费 | 订阅 | 免费 |
左右滑动查看完整表格
Windows v0.17.2 是稳定版。macOS 版是早期预览——安装前请先看说明。
scoop bucket add speaktype https://github.com/wookat/scoop-speaktype
scoop install speaktype
安装包未签名——SmartScreen 拦截时选择“更多信息 → 仍要运行”。
未经公证:在“隐私与安全性”中允许,或执行 xattr -d com.apple.quarantine /Applications/SpeakType.app。按住 右 Option 说话。本地引擎:SenseVoice 与 Parakeet。
不是独立的语音输入 App:它把你的声音通过局域网或中转传给电脑上的 SpeakType。
除非你选择云端引擎,否则不会。使用内置离线模型时,识别、标点和“从修改中学习”的对比都在本机完成。SpeakType 不运营任何服务器,也不收集任何数据;API Key 与历史记录保存在 %APPDATA%\SpeakType(Windows)或 ~/Library/Application Support/SpeakType(macOS)。
SenseVoice 覆盖中文、粤语、日语、韩语和英语;Parakeet 覆盖英语及 25 种欧洲语言;Whisper(Windows)覆盖最广。云端引擎按各自的语言列表。界面本身提供英文、简体中文、繁体中文、日语和韩语。
代码签名证书要花钱,项目目前还没有这笔预算。安装包由公开源码构建;SmartScreen 会显示“更多信息 → 仍要运行”。macOS 上应用为 ad-hoc 签名、未经公证——安装指南里有一行 xattr 命令可绕过。
目前是预览版。构建、安装、授权和按住说话听写已在 Apple 芯片真机上验证;Intel 版为交叉编译,尚未在 Intel 硬件上运行过。whisper.cpp 与自动从修改中学习目前仅 Windows 提供。
它们复用你在应用内自己登录的会话,并调用未公开接口。默认关闭,随时可能失效,也可能不符合对应服务的条款——账号风险需要你自己判断。不确定就优先用离线引擎或自己的 API Key。详见 DISCLAIMER.md。
可以。一次性下载模型(支持续传、SHA-256 校验、三个镜像源)之后,一切都离线运行。除你配置的云端引擎外,SpeakType 唯一会自行发起的联网是启动时向 GitHub 查一次最新版本号(只请求版本号),可在 设置 → 通用 → “自动检查更新” 关闭,做到严格零联网。绿色版把数据放在可执行文件旁边。
到 GitHub 提 issue。识别失败的录音会保留在本地(最多 20 段 / 7 天),可在历史页重试而不用重说;主日志在数据目录里。