本地识别
发送不发送任何内容
识别在 Voltip 内完成,使用磁盘上的模型文件。唯一的网络访问是下载模型,下载内容会按 SHA-256 校验。
全部功能一览。标记为「开发中」的功能正在开发,尚未包含在正式版本中。
按住 Ctrl+Alt+Space 说话,松开即可。也可以按一次开始、再按一次结束,或短按锁定,用于长段口述。
右 Ctrl、右 Alt、Mac 上的 Fn 键或鼠标侧键,都可以单独用来开始听写。
悬浮窗实时显示识别出的文字。文字可以整段插入、逐句确定,也可以边说边输入。
选中文字,按住 Ctrl+Alt+E 说出修改要求,例如「改得正式一点」或「翻译成英文」,选中的内容会被直接替换。
Qwen3-ASR、SenseVoice 和 Paraformer 在本机运行。模型下载完成后,音频不再离开这台电脑。
Qwen3-ASR 在 Windows 和 Linux 上通过 Vulkan、在 macOS 上通过 Metal 使用显卡,没有可用的显卡时使用 CPU。
正式版安装包内置默认服务;也可以使用自己的密钥,改用 OpenAI、Groq、硅基流动或任意 OpenAI 兼容接口。
修正标点、错别字和口头禅,不改变原意。可以使用默认服务、自己的服务商或本机的 Ollama。
让 Voltip 认识你常用的人名和术语,用字面或正则规则改写短语;中文可以统一为简体或繁体。
根据正在使用的应用,自动选择润色风格、输出方式、语言,以及给 AI 的补充要求。
提供校对、提示词优化、意图整理、口语聊天、中英互译和要点纪要等预设,可在首页、标题栏和托盘切换;另有编程开发、办公写作、即时聊天和专业领域等内置场景。
通过二维码、6 位验证码,或在同一局域网内点选,即可与 Android 手机配对。在手机上按住说话或输入文字,内容会出现在电脑的光标处。
每条结果都保存在本机,可以搜索,也可以复制或粘贴到之前使用的窗口。
按日、周、月统计听写字数、修正字数和节省的时间。
单次录音最长 2 小时,可以录制麦克风、电脑声音或两者混合,并导出 SRT 字幕。
CtrlAltSpace
此时才会打开麦克风。屏幕底部的悬浮窗显示输入音量。
安装实时识别模型后,识别出的文字会随着说话显示在悬浮窗里。
语音被识别,按你的词典纠正,可选经过 AI 润色,再按替换规则改写。
Voltip 把文字粘贴到你正在使用的应用里,并在历史记录中保存一份。任何时候按 Esc 都可以取消。
下载一次模型,听写即可离线使用。Qwen3-ASR 可识别 30 种语言并自带标点;SenseVoice 和 Paraformer 体积小,在普通处理器上也很快。电脑有显卡时,Qwen3-ASR 会通过 Vulkan 或 Metal 使用显卡,否则使用处理器。
正式版安装包还内置了默认的云端服务,无需任何设置即可开始听写。你也可以随时改用 OpenAI、Groq、硅基流动或任意 OpenAI 兼容接口,并使用自己的密钥。
| 模型 | 大小 | 语言 | 运行设备 |
|---|---|---|---|
| Qwen3-ASR 0.6B推荐 | 690 MB | 30 种语言,自动识别 | GPU 或 CPU |
| Qwen3-ASR 1.7B最准确 | 1.7 GB | 30 种语言,自动识别 | GPU 或 CPU |
| SenseVoice Small体积最小 | 240 MB | 中文、英文、日文、韩文、粤语 | CPU |
| Paraformer不带标点 | 227 MB | 中文(含方言)与英文混说 | CPU |
| 实时识别用于边说边预览 | 169 MB | 中文与英文 | CPU |
模型下载支持断点续传,使用前会校验 SHA-256。在 NVIDIA L40S 上实测,Qwen3-ASR 0.6B 识别一段 16 秒的中文语音,GPU 用时 0.16 秒,8 个处理器线程用时 2.87 秒。
识别负责听出每一个字,后续步骤负责让文字准确易读:词典纠正识别器容易听错的人名和术语,AI 润色去掉口头禅并补全标点,替换规则按你的设定改写短语,场景再根据当前使用的应用调整这些处理。
预设功能正在开发 开发中:之后可以在首页、标题栏或托盘中选择校对、提示词优化、意图整理、口语聊天、中英互译和要点纪要。
识别结果
嗯那个我觉得我们周五把这个修复发出去然后下周再更新一下文档吧
插入到光标处
我觉得我们周五把这个修复发出去,下周再更新一下文档。
AI 润色效果示例:去掉口头禅,补全标点,措辞保持不变。
把 Android 手机与电脑配对后,在手机上按住说话:电脑使用自己的识别设置处理语音,并把文字插入电脑的光标处。手机也可以发送输入的文字或剪贴板内容。
Android 应用已经完成并通过测试,但尚未发布,发布后会出现在发布页面。了解手机端
Voltip 在三种桌面系统上是同一个应用,各平台之间的差异见「各平台说明」。
| 平台 | 安装包 | 快捷键与单键 | 本地识别 | GPU |
|---|---|---|---|---|
| Windows 10 和 11已发布 | 按用户安装的安装包或便携版 zip,x64 | 都支持 | 支持 | Vulkan |
| macOS 11 及以上已发布 | Apple 芯片与 Intel 芯片各一个 dmg | 都支持,需要辅助功能权限 | 支持 | Metal |
| Linux已发布 | .deb 或 AppImage,x64;支持 X11 和 Wayland | X11 上都支持;Wayland 上通过系统快捷键运行切换命令 | 支持 | Vulkan |
| Android开发中 | 尚未发布 | 在应用里按住说话 | 由配对的电脑完成 | — |
iOS 尚未开始开发。暂不提供 Windows ARM 和 Linux ARM 的安装包。
取决于你选择的服务。首页和「语音模型」页始终显示当前使用的是哪一项。
发送不发送任何内容
识别在 Voltip 内完成,使用磁盘上的模型文件。唯一的网络访问是下载模型,下载内容会按 SHA-256 校验。
发送音频,发送给你选择的服务
录音发送给内置服务或你配置的服务商,同时附带你的密钥;如果设置了词典,词条也会作为识别提示一并发送。密钥保存在系统钥匙串中。
发送文字,发送给你选择的 AI 服务
发送识别出的文字;语音编辑时发送选中的文字和你的指令。默认附带当前应用的名称,可以关闭;窗口标题仅在你开启后才会发送。不会发送音频。
一条命令即可为这台电脑选择合适的安装包,按发布附带的 SHA256SUMS 校验后再安装。
irm https://raw.githubusercontent.com/sunerpy/voltip/main/scripts/install.ps1 | iexcurl -fsSL https://raw.githubusercontent.com/sunerpy/voltip/main/scripts/install.sh | sh各平台的安装包、校验值和构建证明都在发布页面。安装指南介绍了各个平台的安装方法,包括在 Mac 上首次打开时的步骤。
按预计顺序列出,不承诺日期;每项功能发布后,本站会随之更新。
默认预设「校对」修正错字和标点、删除口头禅,遇到「不对,应该是……」这类改口时只保留改正后的说法。另有提示词优化、意图整理、口语聊天、中英互译和要点纪要等预设,也可以自定义。
历史记录上限从 500 条提高到 2 万条,首页按日、周、月显示听写字数、修正字数和节省的时间。节省时间按说话时长 × 1.9 计算,依据 Ruan 等人 2016 年的研究。
单次录音最长 2 小时,可选择麦克风、电脑声音或两者混合。长录音分段识别,并可导出 SRT 字幕。
手机当麦克风和键盘的功能已经完成并通过测试,应用正在准备发布。
目前边说边出字只使用本地的实时识别模型,今后计划支持云端服务的流式识别结果。
包括 Whisper 等模型,以及在 AMD 和 Intel 显卡上的实测。