模块

Screph 模块及其职责边界

Screph 是在视觉数据上创建 AI 任务的环境。它由用于源获取、标注、计算机视觉方法、项目存储、使用代码和场景执行的模块组成。列出了每个模块的输入、输出和当前限制。

ImplementedExperimentalPlanned
Input

Capture

Implemented

获取并索引视觉源,但不会自行创建标注。

输入区域/窗口/监视器、摄像头、URL 流或一组经过验证的文件和文件夹。
操作定时或动作序列录制、回放、时间线编辑、内存或磁盘存储、源验证和预览。
输出帧、源参考、时间线位置、PNG 导出以及与操作和帧关联的文件。
边界播放媒体文件,而不是录制;高负载实时源可能会降低界面响应能力。
Authoring

Selector

Implemented

拥有主要可编辑项目并将视觉源与域标注连接。

  • 元素,键入视觉特征和选择区域,具有自动或手动成员资格。标注组是主项目格式的一部分,但 Selector 还没有单独的自由格式组编辑器。
  • 特征操作:副本使用单独的图像文件;可以创建图案、网格和派生特征;检查目标点、所有者和源链接、裁剪、蒙版和预览。
  • 关系图显示层次结构、所有者到特征链接、元素和特征关系、所选内容的可见性和属性关系。
  • 画布布局 A/B/C/D 显示一个项目中的不同材料。缩放、平移、光标可联动;布局存储在本地,不是项目包的一部分。
  • 活动图像提供像素检查、放大器、直方图、线条轮廓、图层、导航器以及修订版之间的结果比较。
  • 文本和语音描述可以链接到元素、特征、匹配项、关系和图像序列。语义处理是单独配置的,并且可以自动应用高可信度的类型化规则。
  • 树模块将选定的分支存储在单独的紧凑型 JSON 文件中,并检查它是否与当前项目状态匹配。
Analysis

Computer vision

Implemented

计算机视觉方法创建结果并可能建议标注更改。仅当单独应用此类更改时,主要的标注才会更改。

28 种面板方法

边缘、HSV/K-Means、GrabCut、分水岭、超像素、轮廓和组件、MSER/Hough、阈值、匹配、比较和对齐、KLT、OCR、布局分析和模型支持的分割。

14 个序列节点

灰度、色调和对比度、模糊、CLAHE、调整大小、裁剪、旋转和纠偏、蒙版合成、反转、形态和轮廓提取。

执行和依赖项

单一方法、线性序列或方法图。 OCR 需要 ocr.runtime; YOLO、SAM 和 OmniParser 需要 ml.runtime 和模型文件。

完整目录和模式边界 →

Data

项目和导出

Implemented

主项目软件包使用版本化的 JSON 并保留对结果文件的引用。

  • gui_elements, image_features, feature_matches, markup_groups, edges и regions.
  • 源图像、计算机视觉结果清单、蒙版、轮廓、指标并保存诊断。
  • 自动生成的 for_ai_agent 文件;支持的自动化目标单独准备 main.py
  • 加载和保存期间的架构和文件完整性验证。
Execution

GUI Automation

Implemented

Automation Runtime 读取主项目并执行单独的 Python 场景。 for_ai_agent 文件不是其直接输入,在标注之后不会自动开始执行。

查找并等待

图像和文本匹配、条件等待和记录捕获以进行可重复调试。

输入

点击、移动、文本输入、热键、拖动和滚动 Arduino HID、传统串行或 FakerInput 虚拟 HID。

Automation Manager

场景启动、EVT 遥测、筛选和匹配预览、进度和日志。

Assistance

AI Assistant

Experimental

助手默认关闭。它使用经过编辑的受限数据构建上下文,并仅调用允许的类型操作。图片和文件需要明确许可;预览更改并需要确认。

打开助手指南 →
Recorded actions

Action CV

Experimental

连接操作前后的帧、操作本身、LLM 计划、本地计算机视觉运行、建议的目标、审核决策和导出。原始操作轨迹保持不变以供验证。

Code and speech

Screph Code 和语音

Implemented
  • Screph Code 使用 Monaco 编辑器、OpenHands 运行时和具有版本控制的单独 Pro Agent 进程 JSON-RPC 协议。
  • Builder 可以立即修改所选代码文件夹中的文件。更改和撤消并不涵盖每个代理编辑,因此文件更改需要使用 Git 或其他外部工具进行检查;在运行之前使用单独的副本或分支。
  • IDE 传输支持 VS Code/Codex 桥、Trae、PearAI 和 Window Commander。其他 IDE 扩展包仍然是内部支架。
  • 语音识别使用 Vosk、Yandex、Google 和 OpenAI。可用模式取决于所选服务;语音描述存储在项目中。
  • Voice2Text 是一个单独的系统托盘应用程序,用于可编辑听写、将文本插入 Windows 应用程序、通过 LLM 进行绑定和可选屏幕截图转换。主要应用已实现;当前的旧版 ZIP 需要在发布审核后进行替换。
模块状态

可用的模式并不总是意味着完整的过程

状态和限制