30 秒快速回答
GUI Agent(图形界面智能体,Graphical User Interface Agent) 是让 AI 像人一样「看懂屏幕 → 思考下一步 → 模拟鼠标键盘/触屏操作」去完成任务的一类智能体。它不依赖软件开放 API,只要有界面就能上手操作。2026 年 8 月 20 日,阿里发布 Qwen-UI-Agent,一套模型同时覆盖手机、电脑、网页和深度搜索四类环境,移动端基准 MobileWorld 拿到 82.1%、真机基准高达 92.2%,把这一方向正式推入「基座模型」时代。
一句话价值:当整个世界还没有全部 API 化时,GUI Agent 选择直接把屏幕当作最大的接口——不去等世界 API 化,先学会使用世界本来的样子。
一、为什么「会点屏幕」突然成了最热的方向?
过去一年,AI 智能体的能力边界基本靠 CLI、MCP 这类工具接口撑起来。但现实是:银行页面、政务系统、企业内部老工具……绝大多数软件从来没打算开放 API。GUI(图形用户界面)才是数字世界里覆盖面最广的通用入口。
| 路线 | 前提条件 | 覆盖范围 | 最大痛点 |
|---|---|---|---|
| 传统 RPA | 坐标 / 固定流程 | 界面不变的任务 | 界面一改版脚本就失效 |
| API 调用 | 软件必须开放接口 | 仅接口暴露的功能 | 大量软件根本没有 API |
| GUI Agent | 只要有界面 | 人类能做的都能做 | 对视觉理解能力要求高 |
只要有界面,智能体就能上手操作,软件一行代码都不用改。 这正是 GUI Agent 区别于前两条路线的底层逻辑,也是它 2026 年爆发式增长的原因。
二、GUI Agent 是怎么工作的?三大核心技术
GUI Agent 本质上是一个「视觉-语言-动作」模型(VLM):输入屏幕截图 + 自然语言指令,输出具体操作。以字节跳动开源标杆 UI-TARS(论文 arXiv:2501.12326)为例,有三项关键技术:
1. 增强感知:看懂屏幕再动手
传统视觉模型看到截图只看到像素,不理解”这是个按钮”。GUI Agent 用大规模 GUI 截图数据集训练,能输出结构化的 UI 描述:
{
"elements": [
{ "type": "button", "bbox": [120, 340, 280, 380], "text": "提交订单", "state": "enabled" },
{ "type": "input", "bbox": [120, 200, 400, 240], "placeholder": "请输入手机号", "state": "focused" }
],
"layout": "form",
"page_type": "checkout"
}
2. 统一动作空间:跨平台一套动作
桌面是鼠标、移动端是滑动、浏览器是导航,GUI Agent 把各平台操作统一建模,实现跨平台泛化与轨迹混训:
action = {
"action_type": "click" | "type" | "scroll" | "swipe" | "finished",
"action_inputs": {
"start_box": "(x1,y1,x2,y2)", # 操作的目标区域
"content": "要输入的文字",
"direction": "up"
},
"thought": "上一步操作的结果分析...",
"reflection": "是否需要调整策略..."
}
3. 慢思考 + 反思式训练:会纠错的智能体
每一步操作前先做任务分解、里程碑识别、反思纠错(System-2 推理);再通过「反思式在线轨迹训练」,让模型在数百台虚拟机自动生成的交互轨迹中不断从错误里学习,几乎不需要人工标注。
三、主流 GUI Agent 项目对比
| 项目 | 厂商 | 发布时间 | 核心特点 |
|---|---|---|---|
| Qwen-UI-Agent | 阿里 | 2026-08 | 跨端基座模型,真机训练,GUI + CLI 混合 |
| UI-TARS | 字节跳动 | 2025-01 | 开源原生端到端 GUI Agent(GitHub 34K+ Star) |
| Claude Computer Use | Anthropic | 2024-10 | 首个大规模展示的 Computer Use 能力 |
| OpenAI Operator | OpenAI | 2025-01 | 主打浏览器操作 |
| 微软 UFO | 微软 | 2024 | 系统级 API + 多设备编排 |
最新标杆:阿里 Qwen-UI-Agent 的成绩单
- 移动端:MobileWorld 82.1%、真机基准 MobileWorld-Real 92.2%、AndroidDaily 97.5%
- 电脑端:OSWorld-Verified 79.5%
- 网页:WebArena 73.6%(位列所有对比模型第一)
- 界面定位:ScreenSpot-Pro 81.5%(刷新 SOTA)
它最大的底牌是真机训练:搭建 100 多台真实手机、150 多款应用的真机环境,自建 400 多任务的真机基准 MobileWorld-Real,打通「从模拟到真实」的最后一公里——此前各家多在模拟器里训练、评测,一到真机就掉链子。同时支持 GUI + CLI 混合动作,约 40% 动作批量输出,执行步数更少、轨迹更短。
四、能做什么?边界在哪?
典型场景:
- 跨应用长任务:查高铁车次 → 算地铁通勤时间 → 钉钉自动约会议,一条指令跨五六个 App 串联完成
- 无 API 的存量系统:老旧内部系统、政务平台,无需改造即可自动化
- 软件测试与 UI 自动化:自然语言描述用例,AI 在真实界面执行并验证
- 无障碍辅助:帮视障用户读屏、替不熟悉软件的人完成操作
现实挑战:
- 屏幕数据隐私:模型必须读取屏幕内容,上传策略是争议焦点
- 误点幻觉:小尺寸、高密度界面上偶尔会把「取消订单」误认成「确认支付」
- 执行效率:截图-识别-决策-操作循环比人类手速慢
- 生态博弈:微信等超级 App 的风控会拦截「非人类操作」
安全设计是底线。 Qwen-UI-Agent 面对违法或高风险请求不做任何界面操作、直接拒绝;面对支付、删除数据、隐私授权等敏感场景,会在关键一步主动停手、说明情况,等用户确认后才继续——”危险请求不执行,敏感操作不擅自决定”。
总结要点
- GUI Agent = 看懂屏幕 + 思考决策 + 模拟操作,无需 API 即可操作任何软件。
- 核心技术是「视觉-语言-动作」模型:增强感知 + 统一动作空间 + 慢思考推理。
- 2026 年进入基座模型时代:阿里 Qwen-UI-Agent 以真机训练领跑全行业。
- 跨应用长任务是最大增量,但隐私、幻觉与安全边界是必须跨过的坎。
延伸阅读: 本系列《怎么让 AI 操控电脑?Computer Use 完全指南》(guide-34)、《什么是 MCP 协议?一文读懂 AI 的 USB 接口标准》(guide-21)、《什么是 Agent 记忆系统?AI Agent 长期记忆技术全解析》(guide-59)。