Alpha · Windows

Voice2Text:听写、绑定和 LLM 处理

Voice2Text 是一个单独的 Screph 应用程序,用于听写和将文本插入到兼容的 Windows 目标中。可以在插入之前查看已识别的文本。绑定还可以捕获选定的屏幕区域,将图像和听写发送到配置的 LLM,并插入转换后的响应。

视频

当前存档

Voice2Text 在 ZIP 存档解压到单独的目录后从 Voice2Text.exe 运行。该应用程序从系统托盘运行;不需要单独的安装程序。

下载当前的 Alpha 存档

实施了什么

  1. 录音从带有 的托盘中打开开始录音Show widget 显示现有的小部件。
  2. Voice2Text 通过选定的语音提供者转录语音并显示审核的文本。 Ctrl+输入完成输入; Esc 关闭或取消当前小部件。
  3. 正常结果将发送到活动的兼容 Windows 目标。这是输入模拟,不是每个应用程序的通用 API;处于其他权限级别或使用自定义编辑器的目标可能会拒绝文本。
  4. 绑定会记住目标窗口和点。在插入之前,应用程序执行并验证真实的点击、前台状态和点所有权;如果验证失败,插入将停止。
  5. 绑定可以定义捕获区域和 LLM 配置文件。然后,将区域图像和口述请求发送到模型,并将转换后的响应插入到目标中。

菜单和设置

表面当前合同
托盘菜单开始录制、显示小部件、绑定(管理和快速新绑定)、设置、LLM 历史记录、语言和退出。
设置应用程序、识别、LLM、屏幕 Capture 和绑定,包括自动启动、剪贴板行为和历史记录持久性。
绑定一个窗口的多个按钮或点,以及屏幕区域、LLM 配置文件和插入方法选择。
自动启动启用后,Voice2Text 将其命令写入 HKCU\Software\Microsoft\Windows\CurrentVersion\Run

识别和网络使用

Provider它的作用数据边界
Vosk本地流媒体识别;当前的 ZIP 已包含小型俄罗斯模型。音频不会发送到语音云。其他语言或模型需要单独提供的本地文件。
Yandex云语音识别。音频和请求参数发送到配置的 Yandex 服务。
GoogleGoogle 使用凭据文件的云语音。音频发送至 Google;设置存储凭据路径,而文件保留在该路径中。
OpenAI通过配置的 API 进行云转录。音频发送到配置的 OpenAI 兼容端点;密钥通过系统秘密存储存储。
LLM binding通过可选区域捕获转换听写。文本和所选图像转到个人资料提供商;仅对允许您发送的数据启用此功能。

本地数据和历史记录

  • 在打包运行中,设置、模型和启用的基于文件的 LLM 历史记录位于应用程序旁边的便携式 Voice2TextData 目录中。 VOICE2TEXT_CONFIG_DIR 选择另一个数据根。
  • 打包应用程序绑定目前是一个例外:它们存储在 %APPDATA%\Voice2Text\bindings.json 中,而不是在 Voice2TextData 中。
  • 日志首先在可执行文件旁边创建为 voice2text.log;如果该位置不可写,则使用 %LOCALAPPDATA%\Voice2Text\logs
  • API 密钥通过 keyring/Windows Credential Manager 存储。普通设置包含端点、模型和路径,但不应包含明文密钥。
  • 内存中 LLM 历史记录仅限于 200 个条目。默认情况下,对文件的持续提示和响应处于关闭状态,可以由用户启用并可以在 UI 中清除。
  • 始终复制选项将识别或转换后的文本放置在系统剪贴板上;记录 Windows 剪贴板历史记录。

系统要求

  • OS: Windows 10/11 x64.
  • Devices: 一个正在工作的麦克风;屏幕和目标绑定需要交互式 Windows 桌面。
  • Offline: 捆绑的 Vosk 模型可在本地识别俄语。云语音和 LLM 提供商及其检查需要网络访问权限和您自己的凭据。
  • 可选 Python: 新的独立版本不捆绑 Torch、Transformers、Whisper 或 Librosa;需要时,它们通过 Voice2TextData\optional-python\site-packages 和可选-依赖项清单提供。