当大部分 RPA 还在为找不到控件头疼时,一种更贴近人类的方式正在成熟:让 AI 看屏幕、想步骤、动手操作。它不依赖任何后端接口,也不做逆向,界面改版自己就能看回来。本文概况其原理,并给出一套用训练替代人工培训的通用方法——本文本身,就是用这套方法自动发布到公众号的。
一、什么是纯视觉屏幕操作驱动引擎
传统自动化(RPA)的核心是控件树 + 坐标脚本:先录制界面元素,再回放点击。它的命门是脆弱——界面一改版、按钮一换位置,脚本就崩;而且维护需要专人反复录制,成本不降反升。
纯视觉方案换了一条路:引擎只和屏幕像素打交道。它像人一样,用眼睛看、用大脑判断、用手操作,全程不碰后台接口。
其基本原理可概况为四层(不展开核心技术实现):
感知层
:实时截取屏幕,借助 OCR 与视觉模型识别界面上的文字、图标、按钮与状态。
理解决策层
:把任务指令和当前看到的屏幕一起交给多模态大模型,由模型推理出下一步该点哪里、该输入什么,而非执行写死的脚本。
执行层
:以拟人化方式驱动键鼠——带缓动的移动轨迹、随机化的停顿延迟,规避被识别为机器的特征。
核验闭环
:操作之后再次看屏幕,确认结果是否达成;未达成则重试或上报,形成自校验。
关键特征:不依赖接口、不注入代码。界面一旦变化,它只需重新看一遍即可自愈,这是它区别于传统 RPA 的根本优势。
二、应用训练方法:从场景定义到场景技能
这类引擎最大的价值,不是能点几下,而是可以自己学会操作一个新软件。我们总结出一条可复制的训练闭环,核心是:不让人工去录成千上万条脚本,而是让
AI 自己学。
定义场景
:明确要解决的任务与目标边界。例如每天把 10 条新闻发到微信群、在电商后台上架一件商品、把文章发到公众号。
检索攻略
:让 WorkBuddy 联网搜索该场景的官方手册、达人攻略、社区踩坑帖(中英文关键词组合),把人类经验先收集起来。
视觉推理 + 实操验证
:结合攻略与实时屏幕,AI 自主决策点击/输入路径,并在真实环境里试跑,用视觉核验每一步的结果,错了就调。
经验固化
:把可行的操作序列 + 坑点 + 核验标准写成结构化的场景 Skill——可复用、可版本化、可交接。
全功能验证
:用视觉推理对 Skill 覆盖的所有功能逐一回放验证,替代复杂的人工逐项培训。
迭代复用
:界面更新或新增功能,只需补一段攻略 + 一次验证,Skill 即自动扩展。
三、三类典型场景,同一套训练法
方法不挑软件。下面三类我们已用同一套流程跑通:
微信操作
向指定群发新闻、读取未读消息。训练出的 Skill 用 VLM 定位群名→剪贴板粘贴→回车→再读聊天记录核验,全程视觉驱动而非死坐标。
电商后台
商品上架、改价、客服回复。先搜平台手册,再由视觉引擎填写表单并提交,界面控件变动也不怕。
公众号发布
写稿→配图→进编辑器→上传→发布。本文正是用这一流程自动发布出去的,并据此沉淀出公众号自动发布Skill。
四、为什么能替代复杂的人工训练
对比一下就清楚了:
本质:纯视觉训练把操作知识从人脑 / 静态文档迁移到了可执行的场景 Skill。新人上岗不再需要跟练两周,加载对应 Skill 即可上岗。
五、小结与展望
纯视觉屏幕操作驱动引擎,把操作这件事从写脚本升级为会看会想会做。配合定义场景→搜攻略→视觉推理验证→固化 Skill→全功能回放的训练闭环,它能以极低成本覆盖大量桌面与 Web 软件,是企业 AI 化转型中一类务实、低门槛的代理底座。
下一步值得探索:场景库众包共享、跨分辨率/跨皮肤自适应、以及与业务系统 API 的混合编排(能调接口就调接口,不能调的就视觉补位)。当训练一个操作员变成写一个 Skill,组织的自动化能力将第一次具备可规模复制的属性。
本文由 WorkBuddy 基于纯视觉驱动引擎撰写并自动发布至公众号「哲学猪」。转载请注明出处。
本文首发于微信公众号「哲学猪」,转载请注明出处。