多模态智能体不仅要知道调用哪个工具,还要从截图、票据或图表中准确读取参数。MM-ToolSandBox 为这类能力提供了有状态执行环境,覆盖 16 个应用领域和 500 多个工具,任务包含多图片、多轮对话、目标修改、纠错与状态变化。

评测结果暴露“看错但想对”

基准包含 258 个经人工验证的标准场景,以及 50 个面向交互式 UI 的变体。研究者评测了从 4B 开放权重模型到前沿闭源系统的 12 个模型,论文报告最强模型的任务成功率仍不到 50%。

失败分析尤其值得注意:53% 的失败来自图片信息提取错误,尽管相应任务流程本身是正确的。作者还观察到随模型规模变化的瓶颈迁移——小模型更常不知道下一步做什么,大模型则更常在计划正确时看错具体内容。

对智能体开发者的影响

传统工具调用测试常提供干净的文本参数,无法覆盖真实 UI 中的小字、坐标、单位、跨图关联和逐轮更新。产品测试应把视觉感知与规划分别计分,并在工具执行前加入类型、范围和业务规则校验。

对于金额、日期、收件人等高风险字段,可以要求模型回传证据区域,或用 OCR、结构化解析器做第二通道比对。更强的规划模型不能替代输入层的精确读取。

我的判断

这个基准提醒团队,视觉智能体的“最后一公里”常是参数精度而非宏观推理。优化路线也应随失败类型变化:小模型可能需要更好的计划与状态管理,大模型则需要更高分辨率感知、局部重读和执行前验证。

一手来源:MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents