v0.17.2 Windows 稳定版 · macOS 预览版 · 豆包登录即用

你会说,
它会打字。

按住 右 Ctrl 说话、松开,文字直接落到任意应用的光标处。识别默认在你自己的电脑上完成;识别引擎、AI 润色和热词词典都由你自己掌控。

  • MIT 开源
  • 默认离线
  • 无账号、无遥测
  • 5 种界面语言

Windows 10/11 x64 · macOS 预览版(Apple 芯片) · 更新说明与历史版本

0台自有服务器——除非你选择云端引擎,音频不会离开本机
4档离线模型可选:SenseVoice、Parakeet int8 / fp32、Whisper
5种界面语言:English、简体中文、繁體中文、日本語、한국어
MIT开源——协议、纠错逻辑和界面每一行都可读
为什么选 SpeakType

属于你自己的语音输入

大多数 AI 语音输入是闭源的,你的声音要经过厂商服务器。SpeakType 没有服务器——音频只去你指定的地方,或者哪儿都不去。

完全开源

MIT 许可。协议、纠错算法、界面——每一行代码都可读、可改、可自部署。

本地优先,没有后端

识别默认在你的电脑上完成。只有当配置了云端引擎,音频才会发出去——而且只发到那个地址。

从你的修改中学习

落字后手动改掉一个错词,SpeakType 会把 {错 → 对} 学进你的词典。同一个错误,不会犯第二次。

免按连续听写

按一下 Alt+Q 或双击热键进入。按静音自动断句,停顿更久自动分段,随时 Esc 取消。可选语音命令。

选中即改写

选中一段文字,按住 F8 说“翻译成英文”或“改正式一点”——选区原地被替换。中途切了窗口?结果会留在剪贴板等你。

按应用切换人设

Alt+1…9 切换风格——默认、自动翻译、汇报老板、命令行、你自己的提示词——也可以按前台应用自动切换。

手机当麦克风

电脑没麦克风?扫码后对着手机说。局域网直连,或走一个可自部署的中转。

音视频文件转写

拖入音频或视频(mp3、wav、m4a、mp4…最长 3 小时),离线分段转写带时间轴,导出 TXT、SRT 或 VTT。

一分钟上手

从下载到听写

安装

运行安装包,或解压绿色版——它把配置放在 .exe 旁边。

选一个引擎

设置 → 语音 → 内置离线模型(一键下载),或者填入你自己的 API Key。

按住说话

光标放到任意位置,按住 右 Ctrl(或鼠标侧键),说完松开。

越用越准

手动改一个词,它就自动进词典——准确率随使用累积。

识别引擎

四档离线模型,或自带 Key

在应用内下载一次模型,之后永远离线——或者把 SpeakType 指向任意 OpenAI 兼容接口。随时切换。

模型大小适合说明
SenseVoice Small默认240 MB中文、粤语、日语、韩语、英语实测每句纯识别约 0.27 秒(端到端约 0.6 秒),自带标点
Parakeet TDT 0.6B v3int8670 MB英语 + 25 种欧洲语言英文准确率最高;int8 偶尔会吞掉句首第一个词
Parakeet 全精度fp32 · 可选2.5 GB与 Parakeet 相同修复句首吞词;加载后约占 2.7 GB 内存,实测速度与 int8 相同
Whisper tiny / base / smallwhisper.cpp · 仅 Windows32 / 60 / 190 MB语言覆盖最广tiny 最快但易错;small 最慢也最准

左右滑动查看完整表格

中断后断点续传 SHA-256 完整性校验 三个下载源:Hugging Face → hf-mirror → GitHub Releases 传输停滞自动换源 失败提示说人话,可一键重试
自带 Key

任意 OpenAI 兼容接口

  • Base URL + API Key + 模型名,走 /audio/transcriptions
  • 预设:OpenAI Whisper、Groq(有免费额度)、Fireworks、Mistral Voxtral、硅基流动、阿里云百炼
  • 一键测试连接
无需 API Key

登录即用的网页服务

  • ChatGPT 网页转写(免费 OpenAI 账号即可)
  • 豆包语音——登录后立即可用
  • 默认关闭;使用的是未公开接口,请先阅读免责声明
AI 润色

任意对话模型,或者不用

  • OpenAI、Gemini、Groq、DeepSeek、智谱 GLM-4-Flash、Kimi、通义千问…
  • 本地 Ollama / LM Studio 接口(API Key 可留空)
  • 不配也行:本地规则仍会修掉口误改口(“五点——不,六点” → “六点”)
界面一览

为每天使用而设计,深浅两色

实时跟随系统主题。下面每一张都是 Windows 版的真实截图(英文界面;应用本身可切换简体中文)。

SpeakType 首页:今日听写统计、热键提示与引擎状态
首页——统计、热键与引擎状态一目了然
手机当麦克风

电脑没麦克风?用手机。

在设置里扫一下二维码,按住手机上的按钮说话。文字落到电脑光标处,和本地录音完全一样。

  • 局域网直连——手机和电脑在同一个 Wi-Fi 下,数据不出内网。
  • 不在一起时走中转——官方中转是一个很小的 Cloudflare Worker,一条命令即可自部署。
  • 浏览器或 App——用任意手机浏览器打开链接,或安装体积很小的 Android APK。
  • 配对稳定——刷新后自动重连,第二台手机接管房间时干净交接。
对比

和常见方案比一比

对比大家通常会用的闭源语音输入工具。

SpeakType典型 AI 语音输入系统自带听写
源代码开源(MIT)闭源闭源
完全离线可用是——4 档本地模型通常仅云端部分
音频去哪儿不出本机,或你指定的接口厂商服务器厂商服务器
自带引擎 / Key支持不支持不支持
从修改中自学纠错自动手动词典
免按听写 & 选中改写支持不一定有限
手机当麦克风支持
价格免费订阅免费

左右滑动查看完整表格

下载

获取 SpeakType

Windows v0.17.2 是稳定版。macOS 版是早期预览——安装前请先看说明。

Windows

稳定版 · v0.17.2

Windows 10 / 11,x64

scoop bucket add speaktype https://github.com/wookat/scoop-speaktype
scoop install speaktype

安装包未签名——SmartScreen 拦截时选择“更多信息 → 仍要运行”。

Android

手机麦克风

桌面版的配套 App——也可以直接用手机浏览器打开二维码链接

不是独立的语音输入 App:它把你的声音通过局域网或中转传给电脑上的 SpeakType。

我们验证过什么

  • 每个 Windows 版本都在真实 Windows 11 机器上跑过:打包安装、模拟麦克风与热键、100 / 125 / 150% DPI
  • macOS 预览版在 Apple 芯片真机上:构建、安装、授权、按住说话 → 文字落入“文本编辑”
  • Parakeet fp32 的离线 A/B 语料对照与真实 2.5 GB 下载
  • 手机麦克风的局域网与公网中转链路(浏览器模拟手机),含接管与重连

还没验证的——如实说明

  • macOS:签名 / 公证、Intel 硬件、物理麦克风与键盘;“从修改中学习”与 whisper.cpp 目前仅 Windows
  • Windows:物理麦克风硬件(测试用的是模拟音频设备)以及使用真实付费 Key 的云端服务商
  • 真实手机或真机上的 Android APK;fp32 在低内存机器上的长期内存表现
常见问题

你可能想问

我的声音会离开电脑吗?

除非你选择云端引擎,否则不会。使用内置离线模型时,识别、标点和“从修改中学习”的对比都在本机完成。SpeakType 不运营任何服务器,也不收集任何数据;API Key 与历史记录保存在 %APPDATA%\SpeakType(Windows)或 ~/Library/Application Support/SpeakType(macOS)。

支持识别哪些语言?

SenseVoice 覆盖中文、粤语、日语、韩语和英语;Parakeet 覆盖英语及 25 种欧洲语言;Whisper(Windows)覆盖最广。云端引擎按各自的语言列表。界面本身提供英文、简体中文、繁体中文、日语和韩语。

为什么安装包没有签名?

代码签名证书要花钱,项目目前还没有这笔预算。安装包由公开源码构建;SmartScreen 会显示“更多信息 → 仍要运行”。macOS 上应用为 ad-hoc 签名、未经公证——安装指南里有一行 xattr 命令可绕过。

macOS 版能日常使用了吗?

目前是预览版。构建、安装、授权和按住说话听写已在 Apple 芯片真机上验证;Intel 版为交叉编译,尚未在 Intel 硬件上运行过。whisper.cpp 与自动从修改中学习目前仅 Windows 提供。

ChatGPT 和豆包这两个“免 Key”服务商怎么回事?

它们复用你在应用内自己登录的会话,并调用未公开接口。默认关闭,随时可能失效,也可能不符合对应服务的条款——账号风险需要你自己判断。不确定就优先用离线引擎或自己的 API Key。详见 DISCLAIMER.md

可以完全不联网使用吗?

可以。一次性下载模型(支持续传、SHA-256 校验、三个镜像源)之后,一切都离线运行。除你配置的云端引擎外,SpeakType 唯一会自行发起的联网是启动时向 GitHub 查一次最新版本号(只请求版本号),可在 设置 → 通用 → “自动检查更新” 关闭,做到严格零联网。绿色版把数据放在可执行文件旁边。

出问题了去哪儿反馈?

GitHub 提 issue。识别失败的录音会保留在本地(最多 20 段 / 7 天),可在历史页重试而不用重说;主日志在数据目录里。

别再敲键盘了,开口说。

免费、开源、默认离线。一分钟装好,你的声音只属于你。

v0.17.2 · MIT · GitHub 源码