这项发表于 Hugging Face Daily Papers 2026 年 7 月 23 日的工作,把教育大模型的评测目标从考试答题推进到课程认知:模型不仅要知道答案,还要理解知识如何按教材组织、衔接和呈现。

从题目正确率转向课程结构

K12-KGraph 从人民教育出版社的官方教材中抽取知识,覆盖小学、初中和高中阶段的数学、物理、化学与生物。图谱包含 9 类节点和 14 类关系,描述先修链、概念分类、实验与概念的联系、教学顺序,以及文本知识与视觉内容之间的对应关系。

研究者据此构建了 K12-Bench,共有 23,640 道多选题,分为 Ground、Prereq、Neighbor、Evidence 和 Locate 五类任务。它不只检查模型是否记住某个知识点,还考察模型能否沿课程结构定位相邻概念、识别先修关系并找到相关证据。

当前模型的课程认知仍有限

在以完全匹配为标准的评测中,Gemini-3-Flash 得分为 57%,Gemma-4-31B-IT 为 46%。其中 Prereq 和 Neighbor 最难,说明即使模型能够回答不少教育题目,也未必稳定掌握知识点之间的依赖和邻接关系。

配套的 K12-Train 包含 7,335 个监督微调样本,其中有 2,267 个纯文本问答和 5,068 个多模态视觉问答。在统一为约 2,300 个样本的预算下,K12-Train-Text 在 GaokaoBench 和 EduEval 上持续优于八种主流指令微调语料的等规模子集,表明围绕课程图谱组织的领域监督比一般指令数据更有针对性。

我的判断

这项工作的价值主要在于重新定义教育模型的能力边界,并把教材、知识图谱、评测集和训练集串成一条可验证的数据链。它适合研究课程导航、知识诊断和教材视觉理解,但不能仅凭这些结果推断模型具备可靠的教学能力。数据来自特定出版社和四个学科,向其他教材体系、地区课程及开放式辅导场景迁移的效果仍不明确;摘要也未提供图谱抽取质量、数据污染控制等细节,因此现阶段更应把它看作课程认知评测的起点,而非教育大模型能力的完整结论。