Alpha · Windows
Voice2Text:听写和文本处理
Voice2Text 是一个独立的 Screph 程序,用于听写文本并将其粘贴到兼容的 Windows 窗口中。您可以在插入之前检查文本。窗口捕捉可以选择将选定的快照和听写传送到自定义语言模型 (LLM)。
视频
加载中
将 ZIP 解压缩到单独的目录中并运行 Voice2Text.exe。程序从系统托盘运行;无需安装程序。
下载 Alpha 存档
- 文件
- Voice2Text_latest.zip, 340.5 MB
- SHA-256
effbb4bba5a1db5ba40ace13b9eb420aac2b43064994583ff0aecd23c39fe9bb
实施了什么
- 从系统托盘菜单开始录制。用于开始录制的全局键盘快捷键当前不可用。
- 语音由所选服务识别,然后可以检查和更正文本。 Ctrl+Enter结束输入,Esc取消输入。
- 验证后的文本将发送到活动的兼容 Windows 窗口。具有不同权限级别的Windows或非标准编辑器可能不接受输入。
- 快照会记住窗口和插入点。在输入之前,Voice2Text 检查所需的窗口是否处于活动状态以及该点是否引用它。
- 您可以选择屏幕区域和LLM配置文件进行绑定。然后为模型提供该区域的快照和口述查询,用户在插入之前检查转换后的响应。
菜单和设置
| 部分 | 机会 |
| 托盘菜单 | 开始录制、显示小部件、绑定、设置、LLM 历史记录、语言并退出。 |
| 设置 | 语音识别、LLM 连接、屏幕截图、快照、自动播放、剪贴板和历史记录。 |
| 绑定 | 一窗几个要点,图像区域,LLM简介和插入方法。 |
数据识别与传输
| 选项 | 数据在哪里处理? |
| Vosk | 安装模型时本地识别语音;音频不会发送到云服务。 |
| Yandex | 音频和请求参数发送到配置的 Yandex 服务。 |
| Google Cloud Speech | 音频与用户的凭据一起传输到 Google。 |
| OpenAI-compatible | 音频发送到指定的兼容服务;密钥存储在系统秘密存储中。 |
| 通过LLM处理 | 文本和选定的照片将从活动配置文件发送到服务。仅使用允许发送到此服务的数据。 |
本地数据
- 设置、本地模型和包含的文件历史记录存储在程序旁边的 Voice2Text 数据目录中。
- 绑定存储在 Windows 配置文件中的
%APPDATA%\Voice2Text\bindings.json 中。
- API 密钥通过 Windows Credential Manager存储。通常的设置仍然是服务地址、型号和文件路径。
- 默认情况下禁用将 LLM 请求和响应写入文件,由用户启用并从界面中清除。
- 连续复制时,识别的文本最终会出现在系统剪贴板中,并且可以保存在 Windows 剪贴板历史记录中。
系统要求
- Windows 10/11 x64.
- 工作麦克风;用于窗口快照和屏幕截图 - Windows 交互式桌面。
- 对于本地识别,需要 Vosk 模型。云服务需要网络和用户凭据。