加纳校级试验WhatsApp家辅Rori,效应量0.36约多学一年

Effective and Scalable Math Support: Evidence on the Impact of an AI- Tutor on Math Achievement in Ghana

Owen Henkel, Hannah Horne-Robinson, Nessie Kozhakhmetova, Amanda Lee

cs.HC

2024-02-15

牛津与Rising Academies在加纳11所学校做校级对照,处理组每周两次30分钟用Rori,477人8个月后增长分差3.01、效应量0.36,约每生5美元。

这篇在解决什么

撒哈拉以南非洲,中学结束时数学达到最低熟练水平的学生不到15%。一对一家教有效,低收入国家请不起。电脑端自适应系统也出过0.47到0.6个标准差的增益,但西非家里有电脑和稳定宽带的人不到20%。手机倒是够用:大约90%的西非人有手机,住在3G覆盖区。

Banerjee和Duflo那组Teaching at the Right Level随机评估大约0.28个标准差,相当于多上1.5年学,代价是培训老师、改学校运转。加纳教育网络Rising Academies把类似元件做成WhatsApp上的数学家辅Rori。要验证的事很具体:在学校自习课用聊天机器人补数学,分数能不能涨,成本能不能压到政策可复制的量级。

方法

Rori按当前能力而不是年级推课。内容是500多节微课,对齐Global Proficiency Framework这套国际最低熟练标准。每节有短讲解和脚手架练习。做错先给提示,再给完整解答。学生用自然语言对话,不是点按钮。底层用了NLP和LLM,用来读懂作答和开放提问。

试验放在该网络的11所学校,校际在地理、人口、课程和教法上相近。随机分到校级:6所对照、5所处理。学生层面随机做不到。处理组每周两次、每次30分钟,在自习课用Rori,老师在场只修设备。对照组同一时段继续常规数学。两边正课课程和课时相同。

试卷是同一套35题,覆盖该框架三到五年级的数感和代数,2023年2月初测、8月末测。基线637名三到八年级学生,两端都考的477人:对照241、处理236。流失160人,主因是出勤不稳。

结果

增长分等于末测减初测。对照均值2.12分(SD 6.30),处理5.13分(SD 7.03),差3.01,独立样本t检验p<0.001。

组别初测末测增长
对照 N=24120.2022.322.12
处理 N=23720.2925.425.13

效应量按Morris的办法,把两组两个时点的标准差池化,Cohen's d为0.36。教育干预里这算中到大:Hattie把0.29标成中等、接近好老师;Kraft把超过0.20 SD的干预当大。对照那2.12分可以看成常规课加重测,处理多出来的部分被写成大约一年或更多的学年进步。

初测分数、性别、年龄两组没有显著差异。流失学生初测更低(18.53对22.26),效应量只在考完全程的人上算,这个缺口不直接改d。论文把Rori的边际成本写成大约每生5美元,含LLM API、手机和3G流量。

为什么重要

这是把LLM家辅塞进低收入学校日常作息的实地数据,不是课堂外的演示。通道选WhatsApp,是因为电脑和宽带到不了、手机到得了。5美元和0.36 SD绑在一起,改课纲、缩班、高剂量真人家教在这个成本带里对不上。

增益里有多少来自自适应、多少来自自习课被换成了结构化练习,这篇拆不开。处理组并没有在放学后再加一小时,比较的是Rori自习对常规自习。

局限与存疑

只有11所学校做校级随机,组间没测到的差异消不掉:校长老师因被观察更认真(霍桑效应),学生家庭背景也可能不均。该网络习惯常规测评,霍桑可能弱一些,但校级聚类标准误论文没报。

全年级共用偏易的卷子,高年级初测就满分,进步被压低;也可能Rori主要帮较容易的题。流失的160人更弱,报告样本偏能坚持来考试的学生。没有按使用时长做剂量曲线。只覆盖该网络第一年。表1处理组写237人,正文写236,差1人。

术语

原文与代码

社区讨论

相关论文

全部论文解读