准用ChatGPT后,测验高7.2个百分点,隔周仍高3.9

Experimental Evidence on the Learning Impact of Generative AI

Zara Contractor, Germán Reyes

econ.GN, cs.HC

2026-07-10

明德学院211名本科生监考实验:准用GPT-4o后当场测验高7.2个百分点,一周后仍高3.9,家教式留下、代写消退。

这篇在解决什么

大学生已经把现成聊天机器人用进作业,但多学会了多少并不清楚。不少实验改过模型,加上教师写的提示,或禁止直接给答案,再不然就拿 AI 去比主动学习、人工辅导。另一些让学生自己决定学多久,花掉的时间和同样时间里学会多少缠在一起。

这篇把时间上限钉死,只估计学习效率。实验在明德学院的监考机房里做,考核都发生在 AI 和资料被收走之后。

方法

第一场到场 211 人,两场都到的 205 人。题目从区块链、碳捕集、CRISPR 基因编辑里随机抽。基线自评知识 1.5(满分 10),五道选择正确率 30.3%。学习最多 35 分钟,写约 500 字分析作文,阅读材料 1248 到 1382 字,随后当场再考 5 道新题。

第二场所有人不能使用 AI 和外部资料,完成 10 道选择和一篇 20 分钟作文。间隔平均 6.98 天。学生事先不知道还有这次考核,只有 5% 查过资料,没有人专门复习。

允许组可以使用任何生成式 AI,座位上登录的是 GPT-4o,并开着 Wikipedia 和图书馆。禁止组不能用 ChatGPT、Claude 等,开着的是 Google、Wikipedia 和图书馆。监考、界面截取和事后自报一起核对。两场都参加 50 美元,只参加第一场 5 美元,成绩另计彩票,结束时抽 30 张、每张 100 美元。

主估计是被允许使用的效果,打开与否都算在内。实际使用则用这一随机分组做工具变量。

结果

配发的 ChatGPT 账号里出现提示的比例高 65.9 个百分点,自报使用任何生成式 AI 高 60.9 个百分点,对照接近零。日志中,56% 的允许组学生用它解释概念,29% 起草,23% 修改,16% 总结阅读。使用者里 88% 觉得有帮助。学习总时长几乎不变,对照 32.6 分钟。写作份额少 5.3 个百分点(对照 53.4%),阅读和检索多 4.4 个百分点(对照 44.5%)。享受程度高 0.58 分(对照 5.22,满分 10)。

结果对照允许组减去对照
当场测验正确率56.3%+7.2 个百分点(0.28 SD)
一周后测验正确率50.0%+3.9 个百分点(0.21 SD)
当场作文总分5.50/10+0.45 分(0.34 SD)
一周后无辅助作文—+0.33 分(0.24 SD)
当场 AI 文本占比6.6%+22.2 个百分点,一周后 +0.7

分组推动才去用的人,当场测验高 10.4 个百分点(0.41 SD)。自评知识两边一起上升,允许组没有报出更强的掌握感。0.28 SD 高于 747 项教育 RCT 的中位效应 0.10 SD,接近结构化人工辅导汇总的 0.29 SD。十四项同类实验合在一起,随机效应均值是 0.19 SD。句向量相似度只升 0.003(对照 0.788)。第二场作文里,证据与例子最高,为 0.35 SD。

增益留不留得住,看学生怎么用,而这个用法没有再被随机。使用者中 61% 只做增强,让 AI 讲解、自己继续加工;9% 只做自动化,让 AI 把作文写掉;27% 两者都有。自动化组当场作文高 1.50 SD,一周后无辅助作文落到比对照低 0.14 SD。增强组当场测验高 0.34 SD,一周后仍高 0.24 SD。混合组当场测验高 0.58 SD,一周后的 0.28 SD 不精确。

没拿到 AI 的对照组,预计自己的正确率会高 25.5 个百分点,是一周后实测 3.9 的 6.5 倍。用过的人只估 3.0 个百分点。

为什么重要

学校能决定准不准用,不能要求每个学生都用。意向处理效应量的就是这个许可。没有教师护栏的 GPT-4o,在时间被封顶的陌生材料上,仍抬高了事后独立完成的测验和作文。当场多出的 7.2 个百分点,一周后还剩 3.9。

留下来的是把模型当讲解器的用法。代写可以让当场交上去的作文更好看,工具一撤,这个优势就没了。论文里的努力模型把讲解写成阅读和检索的更高回报,把代写写成取消自己动笔才拿得到的作文分,于是读和写的投入一起下降。

局限与存疑

机房里没什么别的事可做,35 分钟又是硬顶,AI 没有缩短总学习时间。真做功课时学生会用它省时间,省下来的时间能否抵消增益,这里没有测。论文写明,这不能推出 AI 普及之后总体学习会上升。

按用法拆开是事后比较。纯自动化只占使用者的 9%,其一周后测验低于对照 0.24 SD,p 值为 0.538。当场测验还混有违规:监考记录多 5.6 个百分点,自报多 9.6 个百分点,粗算约占当场效应的 17% 到 22%。去掉违规者后,效应仍在 0.15 到 0.27 SD。第二场没有违规,但测验 0.21 SD 的 p 值为 0.068,作文 0.24 SD 的 p 值为 0.083。

学生平均 GPA 3.68、SAT 约 1386,校内 AI 采用率已超过 80%,女性和一年级偏多。话题只有三个,只追一周。作文主分数是 Prolific 上硕博士评分与 LLM 评分的平均,评分者的领域知识有限。

术语

原文与代码

社区讨论

相关论文

全部论文解读