博科尼大学与 OpenAI 联合实验发现:使用 ChatGPT 的学生作业评分平均高出近 1 分,答案更完整、逻辑更清晰;接受因果推理训练的学生则产生更多独特想法。两者结合效果互补,教育评估需要跟进调整。
博科尼大学与 OpenAI 经济研究团队合作的一项新实验,试图回答一个教育争议:当学生用 ChatGPT 完成现实任务时,作业质量会提高,但原创性会受损吗?结果显示,两者可以兼得——只是各自依赖不同的训练方式。
超过 1000 名本科一年级学生围绕“为学校纪念品商店制定营销建议”这一真实任务提交作业。他们被随机分成四组:仅用 ChatGPT(GPT-4o)、仅接受因果推理训练、两者都用、两者都不用。
因果推理训练是批判性思维的一种具体形式,与 AI 无关。学生通过包含游戏、示例、问题和反馈的练习,学习如何建立因果联系、判断方案为什么有效或无效。作业由人工评分员按五分制打分,再通过自动文本分析统计每份作业的想法数量和多样性、因果推理特征以及与专家内容的相似程度。
能用 ChatGPT 的学生,平均得分比对照组高出近 1 分。他们交出的答案包含更多想法、逻辑更连贯,也更接近专家建议。换言之,AI 让初学者的作业呈现出专业感。
但学生并没有把任务直接丢给 ChatGPT。他们仍要决定问什么、如何判断回复,以及选择提交哪些内容。
完成因果推理训练的学生,在量表上的得分没有提高——量表只衡量建议是否有助于提升学校商店的知名度和使用率,并未考察想法的原创性。
不过,文本分析揭示了分数之外的收获:这些学生的想法更丰富、与同伴相比也更具独特性。他们还能更清楚地解释自己的想法为什么可能有效、在什么条件下会失败。
同时使用 ChatGPT 和接受训练的学生,呈现出两类效果叠加:
也就是说,ChatGPT 负责把答案打磨得更完善,批判性思维训练负责把思路推向更开阔的领地。
当 AI 可以帮学生写出媲美专家的答案,仅看最终结果将越来越难判断学生真正理解了什么。传统评分量表倾向于奖励清晰和结构严谨,却可能忽略一个关键问题:这个答案是不是别人想不到的角度。
作业设计和评估方式也需要随之调整——把原创性、推理过程和多元视角纳入其中,而不是只衡量“答案是否够标准”。
实验的核心结论可以浓缩为一句话:AI 帮助学生给出更好的答案,批判性思维训练帮助学生生成更开阔的思路,二者互为补充。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断