| 指标 | 现状(无本项目) | 应用本项目 | 变化 |
|---|---|---|---|
| 单次任务成本 | 约 0.020 美元 | 约 0.0027 美元 | 降至约 1/7 |
| 单张截图处理耗时 | 数十秒 | 约 0.3 秒 | 缩短两个数量级 |
| 模型无效往返次数 | 11–16 次 | 0 次 | 0 次 |
| 屏幕数据外发 | 需上传至云端服务 | 不出本机 | 不出本机 |
数据来源:同一台设备、同一张截图、同一问题下的对照实测;口径与样本见第 6 页。
让低成本模型具备看图能力。纯文本模型无法读取屏幕;本项目在本机完成识别与整理,使其无需更换为高价视觉模型。
屏幕内容不离开本机。识别、裁剪、整理全部在本地完成,适用于处理含账号、订单、内部信息的界面。
为自动化流程提供稳定输入。同一输入结果完全一致,可作为流程中的可靠环节;云端模型两次结果可能不同。
| 路径 | 做法 | 代价 |
|---|---|---|
| 路径一:交由模型自行摸索 | 模型反复调用工具、截取、裁剪、推测 | 往返 11–16 次;耗时长;结果不稳定 |
| 路径二:改用云端视觉模型 | 将截图上传云端识别 | 按张计费;延迟 12–31 秒且会超时;数据外发 |
两条路径均已实测,非推断。
模型每往返一次,均需重新读取此前全部上下文,成本随之累积。
实测:单张截图的一次问答,因反复尝试而额外消耗约 16,000 字的输入。
时间同源:数十秒的等待主要发生在模型寻找方法,而非生成答案。
结论:减少无效往返,是同时降低费用与耗时的关键。
| 项目 | 说明 |
|---|---|
| 设备与环境 | macOS 27.0(Apple 芯片);同一台设备完成全部对照 |
| 样本 | 同一张含弹窗的屏幕截图;同一问题:“画面上是否有弹窗,内容是什么” |
| 对照方式 | 三种做法各执行一次,记录耗时、往返次数与费用 |
| 计价依据 | 按模型官方单价换算;本地识别环节不调用收费服务 |
若需第三方复核,可按上述口径复跑;样本与脚本随项目一并提供。
全过程在本地完成,不联网、不上传、不产生第三方费用。
系统级识别。使用系统自带文字识别与无障碍接口,读取文字、控件与位置,不依赖外部服务。
按重要性裁剪。优先保留正文与可交互控件,压缩装饰性内容,控制输出体积与模型输入成本。
输出预算与升级判定。对输出长度设上限;信息不足时给出明确标记,由上层决定是否改用视觉模型。
结果可复现。同一输入产生同一输出,便于测试与流程稳定运行。
| 使用量 | 云端视觉方案(按实测单价推算) | 本项目 |
|---|---|---|
| 每天 10 张 | 约 3 美元 / 月 | 0 |
| 每天 100 张 | 约 31 美元 / 月 | 0 |
| 每天 1,000 张 | 约 314 美元 / 月 | 0 |
按实测单价每张 0.0105 美元推算;本地识别仅占用本机算力,不产生按次费用。
| 使用情况 | 建议 |
|---|---|
| 偶发使用(每月数张) | 效益有限,主要体现为体验改善 |
| 经常处理截图、或需桌面自动化 | 建议采用:节省费用与时间,且数据不外发 |
| 使用低成本或纯文本模型 | 建议采用:以本机能力补足看图能力 |
| 使用非 macOS 设备 | 暂不支持 |
已开源:github.com/xuyuelun667-alt/openclaw-plugin-ovp-macos(含实测文档与自动测试)
已上架插件市场:可一行命令安装,安装后可自检环境与权限
质量保障:每次改动自动运行测试;版本与说明同步更新
安装:openclaw plugins install clawhub:@xuyuelun667-alt/ovp-macos
配置:openclaw ovp setup (自动检查并修正配置与系统权限)
下一步:按交付清单完成分发验证与回归测试。
仅支持 macOS,依赖系统自带的识别与无障碍能力。
照片、图表、示意图的语义内容无法识别 —— 该项需借助视觉模型。
无文字、仅含图标的按钮无法识别。
定位:解决“屏幕上有什么、哪里可以操作”,不解决“图像表达了什么”。
| 事项 | 目的一 |
|---|---|
| 补充可复现基准脚本 | 使第三方能自行复跑第 2 页数据 |
| 配套使用说明 | 明确何时适用、何时应改用视觉模型 |
| 增加变化监测 | 按需监测屏幕变化,减少重复读取 |
| 扩展多屏与多语言 | 覆盖多显示器与更多语言环境 |
同一张截图:成本降至约 1/7,耗时缩短两个数量级,数据不出本机。
github.com/xuyuelun667-alt/openclaw-plugin-ovp-macos
2026 年 9 月 27 日