Voice2Text: диктовка, привязки и обработка через LLM
Voice2Text — отдельная программа Screph для диктовки и вставки текста в совместимое окно Windows. Распознанный текст можно проверить перед вставкой. Привязка может дополнительно снять выбранную область экрана, передать изображение и диктовку настроенной LLM и вставить преобразованный ответ.
Видео
Текущий архив
Voice2Text запускается файлом Voice2Text.exe из ZIP-архива, распакованного в отдельный каталог. Приложение работает из системного трея; отдельный установщик не требуется.
Voice2Text 1.0.0 · full · Nuitka · 2026-07-21T21:59:43.4289985Z
Исполняемый файл
AMD64 · PE32+ · Windows GUI
Authenticode
подпись отсутствует
Локальная модель
vosk-model-small-ru-0.22 входит в архив
Что реализовано
Запись открывается из меню трея командой Start recording; команда Show widget показывает уже созданный виджет.
Voice2Text распознаёт речь выбранным speech-provider и показывает текст для проверки. Ctrl+Enter завершает ввод, Esc закрывает или отменяет текущий виджет.
Обычный результат отправляется в активное совместимое окно Windows. Это эмуляция ввода, а не универсальный API всех приложений; цели с другим уровнем привилегий или нестандартным редактором могут не принять текст.
Привязка запоминает целевое окно и точку. Перед вставкой приложение выполняет и проверяет реальный клик, foreground и принадлежность точки окну; если проверка не проходит, вставка прекращается.
Для привязки можно задать область снимка и LLM-профиль. Тогда в модель уходит изображение области вместе с продиктованным запросом, а в цель вставляется преобразованный ответ.
Меню и настройки
Поверхность
Текущий контракт
Меню трея
Start recording, Show widget, Bindings (управление и быстрая новая привязка), Settings, LLM history, Language, Exit.
Настройки
Application, Recognition, LLM, Screen Capture и Bindings; здесь же настраиваются автозапуск, поведение буфера обмена и сохранение истории.
Привязки
Несколько кнопок/точек для одного окна, выбор области экрана, LLM-профиля и способа вставки.
Автозапуск
При включении Voice2Text записывает команду в HKCU\Software\Microsoft\Windows\CurrentVersion\Run.
Распознавание и сеть
Provider
Что делает
Граница данных
Vosk
Локальное потоковое распознавание; текущий ZIP уже содержит малую русскую модель.
Аудио не уходит в speech cloud. Другой язык или модель требуют отдельно указанных локальных файлов.
Yandex
Облачное распознавание речи.
Аудио и параметры запроса передаются настроенному сервису Yandex.
Google
Google Cloud Speech через файл credentials.
Аудио передаётся Google; в настройках хранится путь к credentials, сам файл остаётся по указанному пути.
OpenAI
Облачная транскрипция через настроенный API.
Аудио передаётся OpenAI-совместимому endpoint; ключи сохраняются через системное хранилище секретов.
LLM binding
Преобразует диктовку с необязательным снимком области.
Текст и выбранное изображение уходят provider профиля; включайте это только для данных, которые разрешено передавать ему.
Локальные данные и история
В packaged-запуске настройки, модели и включённая файловая LLM-история находятся в переносимом каталоге Voice2TextData рядом с приложением. VOICE2TEXT_CONFIG_DIR задаёт другой корень данных.
Привязки packaged-приложения сейчас являются исключением: они сохраняются в %APPDATA%\Voice2Text\bindings.json, а не в Voice2TextData.
Лог сначала создаётся рядом с executable как voice2text.log; если каталог недоступен для записи, используется %LOCALAPPDATA%\Voice2Text\logs.
Ключи API сохраняются через keyring/Windows Credential Manager. Обычные настройки содержат endpoint, model и пути, но не должны содержать ключ в открытом виде.
LLM-история в памяти ограничена 200 записями. Запись prompt/response в файл выключена по умолчанию, включается пользователем и очищается из интерфейса.
Опция постоянного копирования помещает распознанный или преобразованный текст в системный буфер обмена; учитывайте историю буфера Windows.
Системные требования
OS: Windows 10/11 x64.
Устройства: рабочий микрофон; для screen/target bindings — интерактивный Windows desktop.
Офлайн: bundled Vosk-модель распознаёт русский локально. Облачные speech/LLM providers и их проверка требуют сети и собственных credentials.
Дополнительный Python: новый standalone build не включает Torch, Transformers, Whisper и Librosa; при необходимости они подключаются через Voice2TextData\optional-python\site-packages и manifest optional dependencies.