跳到正文

Voltip按住说话,松开即输入

文字会出现在任意应用的光标处。识别可以在本机完成,也可以使用你选择的云端服务;AI 润色可以先把文字整理好。

适用平台
Windows、macOS(Apple 芯片与 Intel 芯片)和 Linux。Android 手机应用正在开发中。
音频去向
使用本地模型时,音频不会离开这台电脑;使用云端服务时,只发送给你选择的服务。
Voltip 首页:快捷键、麦克风、语音模型和最近的结果。Voltip 首页:快捷键、麦克风、语音模型和最近的结果。
说话时的悬浮窗:显示输入音量和用于取消的 Esc 键。说话时的悬浮窗:显示输入音量和用于取消的 Esc 键。
AI 润色时的悬浮窗:显示这一步已用的时间。AI 润色时的悬浮窗:显示这一步已用的时间。
文字插入之后的悬浮窗:显示插入的字数和目标应用。文字插入之后的悬浮窗:显示插入的字数和目标应用。

Voltip 能做什么

全部功能一览。标记为「开发中」的功能正在开发,尚未包含在正式版本中。

在任何地方听写

  • 按住 Ctrl+Alt+Space 说话,松开即可。也可以按一次开始、再按一次结束,或短按锁定,用于长段口述。

  • 右 Ctrl、右 Alt、Mac 上的 Fn 键或鼠标侧键,都可以单独用来开始听写。

  • 悬浮窗实时显示识别出的文字。文字可以整段插入、逐句确定,也可以边说边输入。

  • 语音编辑已发布

    选中文字,按住 Ctrl+Alt+E 说出修改要求,例如「改得正式一点」或「翻译成英文」,选中的内容会被直接替换。

识别方式由你决定

  • Qwen3-ASR、SenseVoice 和 Paraformer 在本机运行。模型下载完成后,音频不再离开这台电脑。

  • Qwen3-ASR 在 Windows 和 Linux 上通过 Vulkan、在 macOS 上通过 Metal 使用显卡,没有可用的显卡时使用 CPU。

  • 云端服务已发布

    正式版安装包内置默认服务;也可以使用自己的密钥,改用 OpenAI、Groq、硅基流动或任意 OpenAI 兼容接口。

让文字准确易读

  • AI 润色已发布

    修正标点、错别字和口头禅,不改变原意。可以使用默认服务、自己的服务商或本机的 Ollama。

  • 让 Voltip 认识你常用的人名和术语,用字面或正则规则改写短语;中文可以统一为简体或繁体。

  • 根据正在使用的应用,自动选择润色风格、输出方式、语言,以及给 AI 的补充要求。

  • 提供校对、提示词优化、意图整理、口语聊天、中英互译和要点纪要等预设,可在首页、标题栏和托盘切换;另有编程开发、办公写作、即时聊天和专业领域等内置场景。

手机、历史记录与长录音

  • 通过二维码、6 位验证码,或在同一局域网内点选,即可与 Android 手机配对。在手机上按住说话或输入文字,内容会出现在电脑的光标处。

  • 每条结果都保存在本机,可以搜索,也可以复制或粘贴到之前使用的窗口。

  • 按日、周、月统计听写字数、修正字数和节省的时间。

  • 单次录音最长 2 小时,可以录制麦克风、电脑声音或两者混合,并导出 SRT 字幕。

一次听写的四个步骤

  1. 按住快捷键

    CtrlAltSpace

    此时才会打开麦克风。屏幕底部的悬浮窗显示输入音量。

  2. 说话

    安装实时识别模型后,识别出的文字会随着说话显示在悬浮窗里。

  3. 松开按键

    语音被识别,按你的词典纠正,可选经过 AI 润色,再按替换规则改写。

  4. 文字出现在光标处

    Voltip 把文字粘贴到你正在使用的应用里,并在历史记录中保存一份。任何时候按 Esc 都可以取消。

在本机识别,或使用云端服务 ​

下载一次模型,听写即可离线使用。Qwen3-ASR 可识别 30 种语言并自带标点;SenseVoice 和 Paraformer 体积小,在普通处理器上也很快。电脑有显卡时,Qwen3-ASR 会通过 Vulkan 或 Metal 使用显卡,否则使用处理器。

正式版安装包还内置了默认的云端服务,无需任何设置即可开始听写。你也可以随时改用 OpenAI、Groq、硅基流动或任意 OpenAI 兼容接口,并使用自己的密钥。

本地识别 · 云端服务

模型大小语言运行设备
Qwen3-ASR 0.6B推荐690 MB30 种语言,自动识别GPU 或 CPU
Qwen3-ASR 1.7B最准确1.7 GB30 种语言,自动识别GPU 或 CPU
SenseVoice Small体积最小240 MB中文、英文、日文、韩文、粤语CPU
Paraformer不带标点227 MB中文(含方言)与英文混说CPU
实时识别用于边说边预览169 MB中文与英文CPU

模型下载支持断点续传,使用前会校验 SHA-256。在 NVIDIA L40S 上实测,Qwen3-ASR 0.6B 识别一段 16 秒的中文语音,GPU 用时 0.16 秒,8 个处理器线程用时 2.87 秒。

让文字符合你的原意 ​

识别负责听出每一个字,后续步骤负责让文字准确易读:词典纠正识别器容易听错的人名和术语,AI 润色去掉口头禅并补全标点,替换规则按你的设定改写短语,场景再根据当前使用的应用调整这些处理。

预设功能正在开发 开发中:之后可以在首页、标题栏或托盘中选择校对、提示词优化、意图整理、口语聊天、中英互译和要点纪要。

AI 润色 · 词典与替换规则 · 场景

识别结果

嗯那个我觉得我们周五把这个修复发出去然后下周再更新一下文档吧

插入到光标处

我觉得我们周五把这个修复发出去,下周再更新一下文档。

AI 润色效果示例:去掉口头禅,补全标点,措辞保持不变。

手机当麦克风和键盘 ​

开发中

把 Android 手机与电脑配对后,在手机上按住说话:电脑使用自己的识别设置处理语音,并把文字插入电脑的光标处。手机也可以发送输入的文字或剪贴板内容。

Android 应用已经完成并通过测试,但尚未发布,发布后会出现在发布页面。了解手机端

配对一次
扫描电脑上的二维码、输入 6 位验证码,或在手机的「附近的电脑」里点选这台电脑。随后两台设备会显示同一组安全码,由你核对确认。
在手机上按住说话
音频经 Opus 压缩、端到端加密后实时传到电脑,由电脑完成识别,并把文字插入电脑的光标处。
发送文字或剪贴板
在手机上输入文字或发送手机剪贴板,电脑会像处理听写结果一样把它插入光标处。
不受网络限制
在同一局域网内直接连接;不在同一网络时,可选的中继负责转发加密数据,中继无法读取其中的内容。

支持的平台

Voltip 在三种桌面系统上是同一个应用,各平台之间的差异见「各平台说明」。

平台安装包快捷键与单键本地识别GPU
Windows 10 和 11已发布按用户安装的安装包或便携版 zip,x64都支持支持Vulkan
macOS 11 及以上已发布Apple 芯片与 Intel 芯片各一个 dmg都支持,需要辅助功能权限支持Metal
Linux已发布.deb 或 AppImage,x64;支持 X11 和 WaylandX11 上都支持;Wayland 上通过系统快捷键运行切换命令支持Vulkan
Android开发中尚未发布在应用里按住说话由配对的电脑完成—

iOS 尚未开始开发。暂不提供 Windows ARM 和 Linux ARM 的安装包。

哪些数据会离开这台电脑

取决于你选择的服务。首页和「语音模型」页始终显示当前使用的是哪一项。

本地识别

发送不发送任何内容

识别在 Voltip 内完成,使用磁盘上的模型文件。唯一的网络访问是下载模型,下载内容会按 SHA-256 校验。

云端识别

发送音频,发送给你选择的服务

录音发送给内置服务或你配置的服务商,同时附带你的密钥;如果设置了词典,词条也会作为识别提示一并发送。密钥保存在系统钥匙串中。

AI 润色与语音编辑

发送文字,发送给你选择的 AI 服务

发送识别出的文字;语音编辑时发送选中的文字和你的指令。默认附带当前应用的名称,可以关闭;窗口标题仅在你开启后才会发送。不会发送音频。

安装 ​

一条命令即可为这台电脑选择合适的安装包,按发布附带的 SHA256SUMS 校验后再安装。

powershell
irm https://raw.githubusercontent.com/sunerpy/voltip/main/scripts/install.ps1 | iex
bash
curl -fsSL https://raw.githubusercontent.com/sunerpy/voltip/main/scripts/install.sh | sh

各平台的安装包、校验值和构建证明都在发布页面。安装指南介绍了各个平台的安装方法,包括在 Mac 上首次打开时的步骤。

接下来的计划

按预计顺序列出,不承诺日期;每项功能发布后,本站会随之更新。

  1. AI 预设与内置场景

    开发中

    默认预设「校对」修正错字和标点、删除口头禅,遇到「不对,应该是……」这类改口时只保留改正后的说法。另有提示词优化、意图整理、口语聊天、中英互译和要点纪要等预设,也可以自定义。

  2. 2 万条历史记录与统计

    开发中

    历史记录上限从 500 条提高到 2 万条,首页按日、周、月显示听写字数、修正字数和节省的时间。节省时间按说话时长 × 1.9 计算,依据 Ruan 等人 2016 年的研究。

  3. 长录音与电脑声音

    开发中

    单次录音最长 2 小时,可选择麦克风、电脑声音或两者混合。长录音分段识别,并可导出 SRT 字幕。

  4. Android 应用

    开发中

    手机当麦克风和键盘的功能已经完成并通过测试,应用正在准备发布。

  5. 云端流式识别

    计划中

    目前边说边出字只使用本地的实时识别模型,今后计划支持云端服务的流式识别结果。

  6. 更多本地模型

    计划中

    包括 Whisper 等模型,以及在 AMD 和 Intel 显卡上的实测。

刻意不做的功能

  • 一直监听,或检测到静音就自动停止。麦克风只在录音时打开。
  • 说话人分离、会议检测和批量转写文件。
  • 纯浏览器版本。全局快捷键、向其他应用输入文字和本地模型都需要原生应用。
  • 把历史记录、词典和规则同步到手机。手机只负责麦克风和键盘,处理都在电脑上完成。

Voltip 基于 Apache License 2.0 发布,是 FirLab 的项目之一。内容来自 voltip@9abf817。