OpenAI 公布了一项面向大学教育场景的随机研究,参与者超过 1,000 名学生。研究把 ChatGPT、批判性思维训练、原创性以及学生表现放在同一框架内考察,并采用真实大学作业,而不是脱离课程环境的简化测试。仅从现有摘要看,这项工作的意义主要在于研究问题和实验场景,具体收益仍需结合完整结果判断。

研究关注的不只是作业分数

材料显示,研究同时观察学生表现、答案原创性和批判性思维。这个设计比单纯比较“使用 ChatGPT 后得分是否提高”更完整:生成式 AI 可能帮助学生组织信息、扩展思路或形成回答,但最终产出变好,并不自动意味着学生自身的分析能力同步提高。把原创性与批判性思维纳入评估,有助于区分工具带来的即时产出收益和可能发生的学习变化。

随机研究也比自愿使用调查更有解释力。学生是否主动使用 AI,往往与其技术熟悉度、学习动机和既有能力相关;随机分配有机会减少这些因素造成的偏差。不过,摘要没有说明实验分组方式、课程类型、作业内容、训练持续时间及评价标准,因此目前不能进一步判断不同干预各自贡献了多少,也不能据此推断长期学习效果。

真实作业提升了结论的应用价值

研究使用真实世界的大学作业,使结果更接近教师和学生实际面对的任务。相比标准化小题,大学作业通常涉及资料理解、论证组织和观点表达,也更适合观察 ChatGPT 与批判性思维训练之间是否存在配合关系。

但“真实”也会带来边界:某一门课程或某一种作业中的表现,未必能推广到其他学科、年级和评价体系。现有材料也没有给出效果大小、统计显著性、原创性的定义,或学生是否直接采用模型输出。标题传达了“回答更好、思考更广”的积极方向,但摘要不足以支持更具体的因果结论。

我的判断

这项研究值得关注的地方,是把教育 AI 的评价从效率和分数扩展到原创性与批判性思维,并通过随机设计研究真实作业。对高校教师而言,它可能为课程中的 AI 使用规则和配套训练提供证据线索。不过,在完整论文、分组细节和量化结果公开前,不宜把它解读为 ChatGPT 已被证明能普遍提升学生思维能力。更稳妥的结论是:评估教育 AI 时,工具使用方式与批判性思维训练应被一起考察。