Alpha · Windows
Voice2Text:听写、绑定和 LLM 处理
Voice2Text 是一个单独的 Screph 应用程序,用于听写和将文本插入到兼容的 Windows 目标中。可以在插入之前查看已识别的文本。绑定还可以捕获选定的屏幕区域,将图像和听写发送到配置的 LLM,并插入转换后的响应。
当前存档
Voice2Text 在 ZIP 存档解压到单独的目录后从 Voice2Text.exe 运行。该应用程序从系统托盘运行;不需要单独的安装程序。
实施了什么
- 录音从带有 的托盘中打开开始录音; Show widget 显示现有的小部件。
- Voice2Text 通过选定的语音提供者转录语音并显示审核的文本。 Ctrl+输入完成输入; Esc 关闭或取消当前小部件。
- 正常结果将发送到活动的兼容 Windows 目标。这是输入模拟,不是每个应用程序的通用 API;处于其他权限级别或使用自定义编辑器的目标可能会拒绝文本。
- 绑定会记住目标窗口和点。在插入之前,应用程序执行并验证真实的点击、前台状态和点所有权;如果验证失败,插入将停止。
- 绑定可以定义捕获区域和 LLM 配置文件。然后,将区域图像和口述请求发送到模型,并将转换后的响应插入到目标中。
菜单和设置
| 表面 | 当前合同 |
|---|---|
| 托盘菜单 | 开始录制、显示小部件、绑定(管理和快速新绑定)、设置、LLM 历史记录、语言和退出。 |
| 设置 | 应用程序、识别、LLM、屏幕 Capture 和绑定,包括自动启动、剪贴板行为和历史记录持久性。 |
| 绑定 | 一个窗口的多个按钮或点,以及屏幕区域、LLM 配置文件和插入方法选择。 |
| 自动启动 | 启用后,Voice2Text 将其命令写入 HKCU\Software\Microsoft\Windows\CurrentVersion\Run。 |
识别和网络使用
| Provider | 它的作用 | 数据边界 |
|---|---|---|
| Vosk | 本地流媒体识别;当前的 ZIP 已包含小型俄罗斯模型。 | 音频不会发送到语音云。其他语言或模型需要单独提供的本地文件。 |
| Yandex | 云语音识别。 | 音频和请求参数发送到配置的 Yandex 服务。 |
| Google 使用凭据文件的云语音。 | 音频发送至 Google;设置存储凭据路径,而文件保留在该路径中。 | |
| OpenAI | 通过配置的 API 进行云转录。 | 音频发送到配置的 OpenAI 兼容端点;密钥通过系统秘密存储存储。 |
| LLM binding | 通过可选区域捕获转换听写。 | 文本和所选图像转到个人资料提供商;仅对允许您发送的数据启用此功能。 |
本地数据和历史记录
- 在打包运行中,设置、模型和启用的基于文件的 LLM 历史记录位于应用程序旁边的便携式
Voice2TextData目录中。VOICE2TEXT_CONFIG_DIR选择另一个数据根。 - 打包应用程序绑定目前是一个例外:它们存储在
%APPDATA%\Voice2Text\bindings.json中,而不是在Voice2TextData中。 - 日志首先在可执行文件旁边创建为
voice2text.log;如果该位置不可写,则使用%LOCALAPPDATA%\Voice2Text\logs。 - API 密钥通过 keyring/Windows Credential Manager 存储。普通设置包含端点、模型和路径,但不应包含明文密钥。
- 内存中 LLM 历史记录仅限于 200 个条目。默认情况下,对文件的持续提示和响应处于关闭状态,可以由用户启用并可以在 UI 中清除。
- 始终复制选项将识别或转换后的文本放置在系统剪贴板上;记录 Windows 剪贴板历史记录。
系统要求
- OS: Windows 10/11 x64.
- Devices: 一个正在工作的麦克风;屏幕和目标绑定需要交互式 Windows 桌面。
- Offline: 捆绑的 Vosk 模型可在本地识别俄语。云语音和 LLM 提供商及其检查需要网络访问权限和您自己的凭据。
- 可选 Python: 新的独立版本不捆绑 Torch、Transformers、Whisper 或 Librosa;需要时,它们通过
Voice2TextData\optional-python\site-packages和可选-依赖项清单提供。