告别“纸上谈兵”:阿里开源 Qwen-UI-Agent,让 AI 真正接管真实屏幕
在 AI 智能体(Agent)领域,让大模型像人类一样操作图形用户界面(GUI)一直是个热门方向。然而,很多模型在模拟器里“大杀四方”,一到真机环境就“水土不服”。为了打破这种局限,阿里巴巴正式开源了 Qwen-UI-Agent——一款真正以真实世界为中心的 GUI 智能体基座模型。它不仅全面覆盖了手机、PC、网页及深度搜索环境,更让 AI 具备了在复杂真实设备上无缝操作的硬核实力。
全端制霸,跑分数据全面领跑
Qwen-UI-Agent 并非只在单一场景发力,而是在各大权威测试与实际环境中交出了一份堪称“全能”的成绩单:
- 移动端“霸榜”:在 MobileWorld 测试中,它以 82.1% 的高分将多个国际主流旗舰模型甩在身后。更硬核的是,在阿里自建的百台真机基准 MobileWorld-Real 上,其成功率飙升至 92.2%,在 Android Daily 测试中更是逼近满分。
- PC端“提效”:在 OSWorld-Verified 测试中斩获 79.5% 的佳绩,并且在执行多项任务时,相比基线模型大幅减少了操作步数,真正做到了“少走弯路”。
- 网页端“夺魁”:在 WebArena 网页测试中力压群雄,位列所有对比模型榜首。同时,其通用和 Agentic 能力全面超越训练基座,能够从容应对各种刁钻的长尾需求。
跨越鸿沟,把训练场搬进“真机世界”
从模拟器到真机,是 GUI Agent 落地的“最后一公里”。为了填平这道鸿沟,阿里团队搭建了一个包含 100 多台真实手机、覆盖 150 多个应用的庞大真机移动环境。
这个真实的“训练场”被专门用于任务构建、轨迹采集和模型训练。在此基础上,团队还推出了包含 400 多个任务的 MobileWorld-Real 真机基准。这意味着,研发团队终于可以摆脱虚拟环境的局限,直接根据真机成功率来精准评估和选型模型。
手脚麻利且懂规矩,兼顾高效与安全
作为一个要在真实设备上“替人干活”的智能体,Qwen-UI-Agent 在执行效率和安全性上做足了文章。
在效率方面,它不仅能进行常规的 GUI 界面操作,还能直接执行命令行指令。最亮眼的是它的“批量动作”能力——在单次决策中输出多个连续动作,大幅缩短了执行轨迹,让操作如丝般顺滑。此外,模型支持在超过 100 步的超长轨迹上进行在线强化学习,配合自适应课程学习,持续死磕高难度的长程任务。
在安全方面,它内置了严密的全过程安全判断机制。面对违法或高风险指令,它会果断拒绝并终止任务;而在遇到支付、删除数据、隐私授权等敏感操作时,它会在关键节点主动“踩刹车”,等待人类确认后再继续,绝不自作主张。
结语
Qwen-UI-Agent 的开源,标志着 GUI 智能体正在从“实验室里的跑分机器”向“真实世界的数字员工”迈进。当 AI 真正学会在物理设备上自如穿梭,人机交互的下一个奇点或许已经不远。
🔗 项目主页:Qwen-UI-Agent