移动端大模型正在从对话助手走向个人智能体,但“能操作界面”并不等于“能完成复杂任务”。MobilePA-Bench关注的不是单次点击或离线函数匹配,而是智能体能否在持续变化的应用状态、权限限制和运行错误下,正确调用工具并维持长程规划。

补上两类评测之间的空白

论文认为,现有移动智能体基准大致分为两类。GUI导向的基准主要检查屏幕操作,容易忽略后台工具调用与多步骤规划;静态函数调用基准则通常离线匹配API,无法反映真实运行时约束。两者分别覆盖了“怎么操作”和“选哪个接口”,但都不足以完整评估任务执行过程。

MobilePA-Bench因此采用交互式、有状态、以工具为中心的设计。其可执行沙箱维护实时应用数据库,并向智能体返回结构化反馈。基准覆盖13个功能领域和212种现实移动工具,使后续决策能够受到先前操作结果的影响,而不是把每一步当成相互独立的选择题。

不只考工具选择,还考规划机制

除基础工具使用外,基准进一步考察中央规划智能体的三项能力。第一是子智能体协作,即把复杂任务拆解后,将专业工作委派给具备相应能力的子智能体;第二是记忆使用,通过已存记忆、用户档案和历史偏好理解隐含请求;第三是技能使用,调用预先封装的复合技能,而非每次从头规划全部步骤。

这些维度更接近个人智能体的实际工作方式:任务完成依赖的不只是模型是否知道某个工具,还包括执行顺序是否严格正确、当前权限是否允许,以及出错后能否根据反馈调整计划。论文实验显示,即使是当前前沿大模型,在这些移动场景中仍不可靠;遇到严格工具顺序、权限限制和意外运行错误时,表现会明显下降。摘要未给出具体模型排名和分项数字,因此暂时不能判断哪类模型或架构更占优势。

我的判断

MobilePA-Bench的价值在于把评测对象从“接口匹配准确率”推进到“受运行状态约束的任务执行”,对开发移动端个人助理、工具编排器和多智能体系统更有参考意义。它也明确提示,规划质量必须与权限管理、错误恢复和状态追踪一起评估。

其边界同样清楚:材料只说明了沙箱、领域、工具数量及三类高级能力,尚不足以确认任务对真实设备差异、GUI感知或开放环境噪声的覆盖程度。它更适合衡量工具型移动规划智能体,不能直接替代端到端手机操作、用户体验或安全评测。