跳至正文

SayType 的成长记录

每次更新,
让表达更轻松。

从语音到文字,记录让表达更顺畅、让内容留在身边的重要变化。

录音快捷键

双击后松开手,也能继续听写。

快速按两次 Ctrl+Shift 即可锁定录音,不必一直按住。若当前显示插入失败的卡片,轻点一次则会把卡片中的文字重新插入到光标处。

  • 锁定后无需持续按键,直到再次按下、按 Escape 或达到 12 分钟上限。
  • 两次短按间隔需在 350 毫秒内。没有失败卡片时,单次轻点仍按误触发取消;轻点后再按住则是普通听写。

Windows 上用 Ctrl+Shift 快速切换两次键盘布局,也可能触发录音锁定。

首次推出v1.18.0

转写整理

少一点“嗯、呃”,少一次手动整理。

最终转写可自动过滤停顿语气词“嗯”“呃”和单独出现的“额”,并整理周围的停顿标点,例如“觉得,呃,我们”变成“觉得,我们”。

  • “过滤语气词”设置默认开启,可以关闭。
  • 引用中的语气词、并列列举、当作词语提及、词语组成部分和转述他人的应答会保留。

处理针对上述中文语气词。若结果全部由语气词组成,过滤后按无语音处理;未成对的引号不视为引用。

首次推出v1.18.0

开始使用

从首次打开,一路引导到第一次听写。

重新设计的设置引导依次介绍隐私、引擎选择、麦克风权限、macOS 辅助功能权限和听写练习。中途离开后,下次可以从原来的步骤继续。

  • 模型下载和权限设置可以同时进行,引擎的选择状态与就绪状态分别显示。
  • 新安装默认使用 Qwen3-ASR 0.6B;检测为低配置的设备默认使用 OpenAI。已有安装会保留原来选择的引擎。

OpenAI 需要你自己的 API key,并会将音频发送给服务提供商。首次设置不再提供 1.7B 选项,较大模型可在之后选择。

首次推出v1.15.3

后续改进

  • v1.15.5Windows 的麦克风状态改为依据实际录音尝试判断。设置引导、首页和设置页会显示就绪、权限被拒绝、无设备或错误状态。
  • v1.17.0首次设置简化为选择本地或云端,不再预先提供 1.7B;Groq 和 Nemotron 收进“更多”,当前使用的引擎仍保持可见。
本地模型

新增更大的本地模型,多一种选择。

Qwen3-ASR 1.7B 在 v1.15.0 作为实验性选项加入。如今千问是一个引擎、0.6B 与 1.7B 是它的两种大小,可以分别下载管理,并根据本机听写速度获得切换建议。

  • 下载 1.7B 时仍可继续用 0.6B 听写;下载完成后自动切换,除非你在下载期间已改选其他引擎。
  • 切换到其他服务商再返回千问时,会恢复上次使用的大小。两种大小都下载好后,可以直接在首页切换。

1.7B 现称为“更大”的模型选项,不再标为实验性。切换建议依据本机实测听写速度,不承诺所有设备都能达到相同性能。

首次推出v1.15.0

后续改进

  • v1.15.8点击已就绪的引擎即可启用,也可以用独立的展开按钮查看设置而不切换引擎。云端模型的修改会在当前引擎内生效。
  • v1.17.0千问合并为一个引擎的两种大小,新增基于实测速度的切换建议,并去掉 1.7B 的实验性标签。
  • v1.17.1首页改为紧凑的引擎按钮,千问按钮直接显示大小并支持快捷切换;电脑与云朵图标区分本地和云端引擎。
录音

Mac 录音改用原生音频接口。

Mac 录音从 WebView 麦克风 API 改为 CoreAudio,以处理部分 Mac 上录音开头音量偏低或声音失真的问题。每次听写时才打开麦克风,不再在两次录音之间持续占用。

  • 两次听写之间,macOS 麦克风指示灯不再持续亮起。
  • 这次改动针对音频采集方式,改善声音如何送入识别引擎,并未更换转写模型。

CoreAudio 录音仅适用于 macOS。不同硬件的表现可能不同,并非所有麦克风或蓝牙配置都已验证。

首次推出v1.13.0

后续改进

  • v1.13.2为录音启动和结束设置了等待上限,并明确识别被中断的录音,以便恢复已获得的文字。
  • v1.15.2Windows 和 Linux 也改为每次听写分别打开和关闭 WebView 麦克风流,其录音后端仍与 macOS 不同。
本地听写

长段听写结束后,少等一会儿。

Qwen 可以在你继续说话时处理已录完的片段,不再等到整段录音结束才开始转写。松开快捷键时,剩余待处理的音频也就更少。

  • 后续音频还在录制时,已处理片段的文字就会显示出来。
  • 录音开始时,引擎便开始预热。这是分段处理,与 Nemotron 的实时流式识别不同。

适用于 Qwen 本地听写。完成时间取决于录音内容和设备,不承诺固定幅度的提速。

首次推出v1.9.0

后续改进

  • v1.9.1完善了录音结束时的保护与恢复处理,应对录音事件缺失或延迟到达的情况。
  • v1.14.1新增音频采样覆盖检查,发现缺口后进入恢复流程,而不是自动插入不完整的结果。此版本中,偶发录音尾部丢失的最初触发原因仍在调查。
实时转写

边说话,边看到文字出现。

Nemotron 3.5 成为 SayType 的第二款本地引擎,率先在 Apple Silicon 上提供流式识别。它会在录音过程中实时生成文字,与 Qwen 的批处理方式并存。

  • 每款本地引擎都可以独立下载,并在应用的引擎选择控件中切换。
  • 使用本地引擎时,音频留在设备上。翻译模式已在 v1.16.0 移除。

Nemotron 是适用于 Apple Silicon 和 Windows x64 的实验性选项。提供平台版本,不代表每种设备都已完成端到端验证。

首次推出v1.8.9

后续改进

  • v1.11.0Nemotron 新增 Windows x64 支持,使用 CPU 运行时。
  • v1.15.2Nemotron 开放语言选择,不再像 Qwen 一样固定为自动检测。
  • v1.15.3修改语言后即可在实时听写中生效,无需重启应用。
  • v1.16.0移除独立的翻译模式及其服务商选择、上传同意提示;本地引擎不需要的 API key 输入框直接隐藏。
失败恢复

用保存的录音重试,不必再说一遍。

最初的恢复功能针对本地转写卡住的情况:SayType 会自动重试一次;若仍无法完成,就把录音保存到历史记录中,标为待处理,供之后重试。

  • 后续版本将录音恢复扩展到更多转写失败场景,并改善历史记录中的原因说明。
  • 手动重试会使用当前选择的引擎,因此切换服务提供商或修正 API key 后,可以用保存的录音再次尝试。

重试的前提是音频已成功保存。历史记录最多保留 100 条,保存的录音并非永久备份。

首次推出v1.8.0

后续改进

  • v1.13.3更多失败请求会保留音频和错误原因;重试使用当前引擎,成功后直接替换原来的待处理记录。
  • v1.13.4重试结果为空时仍保留录音;云端转写或翻译在采集不完整时失败,也不再遗漏历史记录。
应用更新

更新版本,不必再找安装包。

v1.4.0 带来了后台更新检查和应用内安装。SayType 每天检查更新,下载可用的新版本,再由你决定何时重启。

  • 也可以在设置中手动检查更新。
  • 安装更新仍需要你主动操作,不会在工作过程中自动重启。

以上功能适用于桌面应用正式版本的内置更新器。

首次推出v1.4.0

后续改进

  • v1.15.6首页更新卡片新增“更新内容”链接,指向该版本的 GitHub 发布说明,方便在重启前查看变化。
本地转写

听写,可以留在自己的设备上。

Qwen3-ASR 为 SayType 带来了设备端语音识别。下载模型后,本地转写无需账号、API key 或网络连接即可运行。

  • 设置页新增模型下载、进度和移除功能,并支持在本地与云端转写之间选择。
  • 下一个版本在 Apple Silicon 上更突出本地设置,并提供首页和菜单栏的快捷引擎切换。

最初面向 Mac 推出,推荐使用 Apple Silicon 进行本地转写。可选的 Groq/OpenAI 转写仍会将音频上传至所选服务提供商;翻译模式已移除。

首次推出v1.4.0

后续改进

  • v1.5.0Apple Silicon 的首次设置开始优先引导使用本地模型,并在首页和托盘中增加切换引擎的入口。
  • v1.6.0本地解码新增录音结束后逐字显示的进度预览。这并不是后来由 Nemotron 提供的实时识别。
  • v1.16.0移除翻译模式,Shift+Alt 改为普通录音快捷键。