现实任务里的“会用上下文”,不只是读懂一段提示词,还要从图表、地图、场景、网页或转换后的长报告中找到证据,再把现场提供的信息用于回答。CLBench-V把这一问题单独拉出来评测,试图区分模型究竟卡在“没找到”“不会用”,还是“没有学会新知识”。
从总分走向能力断点
CLBench-V围绕三个维度组织任务:上下文定位、新信息应用和新知识学习。这样的设计重点不是再增加一个笼统总分,而是帮助定位上下文利用在哪个环节失效。对于包含视觉信息的任务,这种拆分尤其重要,因为模型答错既可能源于没有识别相关图表或页面区域,也可能是在获得信息后未能正确应用。
基准包含转换后的公开评测集与新构造的数据集,覆盖科学、金融、长文档理解、空间推理和基于网页的视觉问答等领域。为降低领域专用任务的构建成本,作者还引入自动化构造与过滤流程。这让基准更容易扩展,但材料没有披露过滤标准及其对数据质量的具体影响。
六个模型仍有明显空间
CLBench-V共有3443个实例,评测了六个近期多模态模型。最佳整体得分只有0.2847,说明在该基准的定义下,多模态上下文学习距离饱和仍很远。不过,现有材料没有给出指标计算细节,因此这一数字更适合用于基准内部比较,不宜脱离评分规则直接解释。
分项结果也显示能力并不统一:InternVL3.5-30B-A3B在上下文定位和新知识学习上表现最佳,Qwen3.5-Plus则在新信息应用上领先。单一总榜因此可能掩盖模型之间不同的能力结构。
我的判断
CLBench-V的主要价值,是把“模型能否利用多模态上下文”从模糊印象转成可分解的诊断框架。对科学图表、金融报告、网页问答或空间决策类应用,它比单纯考查预训练知识更贴近真实需求,也能为模型选型提供分项依据。
边界同样明确:目前结论来自3443个实例和六个模型,只能反映这组任务与模型的阶段性表现;自动构造数据的可靠性、评分指标及各领域样本分布仍需结合完整论文判断。它适合发现能力短板,但不足以单独代表模型在所有多模态生产场景中的上下文学习水平。