Qwen-UI-Agent 的重点并非再做一个只会点击网页的智能体,而是把目标转向真实数字设备:在手机、电脑、浏览器和 DeepSearch 环境中执行跨平台流程,并同时处理界面操作、命令行任务与持续超过百轮的长链路工作。

统一动作空间与真实设备运行时

该系统将多种沙箱环境与大规模真实移动设备运行时结合。其统一动作空间可以交错生成 GUI 操作和 CLI 命令,还能在单次模型响应中批量给出多个动作。这一设计试图减少不同平台之间的接口割裂,也让智能体能够在可视界面之外调用更适合自动化的命令行能力。

报告还引入轻量级 harness 层,用于主动发起服务,以及在移动端和电脑端维持有状态的工作流。相比只响应用户单步指令,这意味着系统希望进一步承担持续执行和主动服务角色。不过,摘要没有给出主动行为的触发规则、权限控制与安全约束细节。

数据飞轮与超长轨迹强化学习

Qwen-UI-Agent 使用类似 AutoResearch 的数据飞轮,让智能体参与构造任务和环境、诊断失败,并规划后续迭代。在线强化学习可处理超过 100 轮的轨迹,训练 rollout 由超过 1 万个并发环境加速。这套方案的核心价值,是把任务生成、失败分析和训练更新连接成持续改进流程,降低对纯人工数据生产的依赖。

评测方面,报告称其在移动端基准上达到领先水平,其中 MobileWorld 得分为 82.1%;在电脑和浏览器任务上,则相对 Opus 4.8、Gemini 3.1 Pro 与 GPT-5.6 Sol 等前沿模型保持竞争力。

我的判断

这项工作的价值在于系统工程整合:真实设备、沙箱、GUI 与 CLI、长轨迹强化学习及自动数据循环被放入同一框架,方向比单一网页基准更接近实际部署。它尤其适合跨应用、多步骤且需要保持状态的自动化流程。

但目前材料只提供摘要级结果,缺少各项评测的完整拆分、运行成本、失败类型和真实设备稳定性数据。超过百轮训练轨迹也不等于部署时能够稳定完成百轮任务。主动服务还会放大权限、误操作和状态管理风险,因此现阶段更适合将其视为一套有竞争力的基础架构,而非已经验证成熟的通用设备执行器。