Alpha · Windows

Voice2Text: диктовка, привязки и обработка через LLM

Voice2Text — отдельная программа Screph для диктовки и вставки текста в совместимое окно Windows. Распознанный текст можно проверить перед вставкой. Привязка может дополнительно снять выбранную область экрана, передать изображение и диктовку настроенной LLM и вставить преобразованный ответ.

Видео

Текущий архив

Voice2Text запускается файлом Voice2Text.exe из ZIP-архива, распакованного в отдельный каталог. Приложение работает из системного трея; отдельный установщик не требуется.

Скачать текущий Alpha-архив

Что реализовано

  1. Запись открывается из меню трея командой Start recording; команда Show widget показывает уже созданный виджет.
  2. Voice2Text распознаёт речь выбранным speech-provider и показывает текст для проверки. Ctrl+Enter завершает ввод, Esc закрывает или отменяет текущий виджет.
  3. Обычный результат отправляется в активное совместимое окно Windows. Это эмуляция ввода, а не универсальный API всех приложений; цели с другим уровнем привилегий или нестандартным редактором могут не принять текст.
  4. Привязка запоминает целевое окно и точку. Перед вставкой приложение выполняет и проверяет реальный клик, foreground и принадлежность точки окну; если проверка не проходит, вставка прекращается.
  5. Для привязки можно задать область снимка и LLM-профиль. Тогда в модель уходит изображение области вместе с продиктованным запросом, а в цель вставляется преобразованный ответ.

Меню и настройки

ПоверхностьТекущий контракт
Меню треяStart recording, Show widget, Bindings (управление и быстрая новая привязка), Settings, LLM history, Language, Exit.
НастройкиApplication, Recognition, LLM, Screen Capture и Bindings; здесь же настраиваются автозапуск, поведение буфера обмена и сохранение истории.
ПривязкиНесколько кнопок/точек для одного окна, выбор области экрана, LLM-профиля и способа вставки.
АвтозапускПри включении Voice2Text записывает команду в HKCU\Software\Microsoft\Windows\CurrentVersion\Run.

Распознавание и сеть

ProviderЧто делаетГраница данных
VoskЛокальное потоковое распознавание; текущий ZIP уже содержит малую русскую модель.Аудио не уходит в speech cloud. Другой язык или модель требуют отдельно указанных локальных файлов.
YandexОблачное распознавание речи.Аудио и параметры запроса передаются настроенному сервису Yandex.
GoogleGoogle Cloud Speech через файл credentials.Аудио передаётся Google; в настройках хранится путь к credentials, сам файл остаётся по указанному пути.
OpenAIОблачная транскрипция через настроенный API.Аудио передаётся OpenAI-совместимому endpoint; ключи сохраняются через системное хранилище секретов.
LLM bindingПреобразует диктовку с необязательным снимком области.Текст и выбранное изображение уходят provider профиля; включайте это только для данных, которые разрешено передавать ему.

Локальные данные и история

  • В packaged-запуске настройки, модели и включённая файловая LLM-история находятся в переносимом каталоге Voice2TextData рядом с приложением. VOICE2TEXT_CONFIG_DIR задаёт другой корень данных.
  • Привязки packaged-приложения сейчас являются исключением: они сохраняются в %APPDATA%\Voice2Text\bindings.json, а не в Voice2TextData.
  • Лог сначала создаётся рядом с executable как voice2text.log; если каталог недоступен для записи, используется %LOCALAPPDATA%\Voice2Text\logs.
  • Ключи API сохраняются через keyring/Windows Credential Manager. Обычные настройки содержат endpoint, model и пути, но не должны содержать ключ в открытом виде.
  • LLM-история в памяти ограничена 200 записями. Запись prompt/response в файл выключена по умолчанию, включается пользователем и очищается из интерфейса.
  • Опция постоянного копирования помещает распознанный или преобразованный текст в системный буфер обмена; учитывайте историю буфера Windows.

Системные требования

  • OS: Windows 10/11 x64.
  • Устройства: рабочий микрофон; для screen/target bindings — интерактивный Windows desktop.
  • Офлайн: bundled Vosk-модель распознаёт русский локально. Облачные speech/LLM providers и их проверка требуют сети и собственных credentials.
  • Дополнительный Python: новый standalone build не включает Torch, Transformers, Whisper и Librosa; при необходимости они подключаются через Voice2TextData\optional-python\site-packages и manifest optional dependencies.