Alpha · Windows

Voice2Text:听写和文本处理

Voice2Text 是一个独立的 Screph 程序,用于听写文本并将其粘贴到兼容的 Windows 窗口中。您可以在插入之前检查文本。窗口捕捉可以选择将选定的快照和听写传送到自定义语言模型 (LLM)。

视频

加载中

将 ZIP 解压缩到单独的目录中并运行 Voice2Text.exe。程序从系统托盘运行;无需安装程序。

下载 Alpha 存档

实施了什么

  1. 从系统托盘菜单开始录制。用于开始录制的全局键盘快捷键当前不可用。
  2. 语音由所选服务识别,然后可以检查和更正文本。 Ctrl+Enter结束输入,Esc取消输入。
  3. 验证后的文本将发送到活动的兼容 Windows 窗口。具有不同权限级别的Windows或非标准编辑器可能不接受输入。
  4. 快照会记住窗口和插入点。在输入之前,Voice2Text 检查所需的窗口是否处于活动状态以及该点是否引用它。
  5. 您可以选择屏幕区域和LLM配置文件进行绑定。然后为模型提供该区域的快照和口述查询,用户在插入之前检查转换后的响应。

菜单和设置

部分机会
托盘菜单开始录制、显示小部件、绑定、设置、LLM 历史记录、语言并退出。
设置语音识别、LLM 连接、屏幕截图、快照、自动播放、剪贴板和历史记录。
绑定一窗几个要点,图像区域,LLM简介和插入方法。

数据识别与传输

选项数据在哪里处理?
Vosk安装模型时本地识别语音;音频不会发送到云服务。
Yandex音频和请求参数发送到配置的 Yandex 服务。
Google Cloud Speech音频与用户的凭据一起传输到 Google。
OpenAI-compatible音频发送到指定的兼容服务;密钥存储在系统秘密存储中。
通过LLM处理文本和选定的照片将从活动配置文件发送到服务。仅使用允许发送到此服务的数据。

本地数据

  • 设置、本地模型和包含的文件历史记录存储在程序旁边的 Voice2Text 数据目录中。
  • 绑定存储在 Windows 配置文件中的 %APPDATA%\Voice2Text\bindings.json 中。
  • API 密钥通过 Windows Credential Manager存储。通常的设置仍然是服务地址、型号和文件路径。
  • 默认情况下禁用将 LLM 请求和响应写入文件,由用户启用并从界面中清除。
  • 连续复制时,识别的文本最终会出现在系统剪贴板中,并且可以保存在 Windows 剪贴板历史记录中。

系统要求

  • Windows 10/11 x64.
  • 工作麦克风;用于窗口快照和屏幕截图 - Windows 交互式桌面。
  • 对于本地识别,需要 Vosk 模型。云服务需要网络和用户凭据。