Effective and Scalable Math Support: Evidence on the Impact of an AI- Tutor on Math Achievement in Ghana
Owen Henkel, Hannah Horne-Robinson, Nessie Kozhakhmetova, Amanda Lee
cs.HC
2024-02-15
牛津与Rising Academies在加纳11所学校做校级对照,处理组每周两次30分钟用Rori,477人8个月后增长分差3.01、效应量0.36,约每生5美元。
撒哈拉以南非洲,中学结束时数学达到最低熟练水平的学生不到15%。一对一家教有效,低收入国家请不起。电脑端自适应系统也出过0.47到0.6个标准差的增益,但西非家里有电脑和稳定宽带的人不到20%。手机倒是够用:大约90%的西非人有手机,住在3G覆盖区。
Banerjee和Duflo那组Teaching at the Right Level随机评估大约0.28个标准差,相当于多上1.5年学,代价是培训老师、改学校运转。加纳教育网络Rising Academies把类似元件做成WhatsApp上的数学家辅Rori。要验证的事很具体:在学校自习课用聊天机器人补数学,分数能不能涨,成本能不能压到政策可复制的量级。
Rori按当前能力而不是年级推课。内容是500多节微课,对齐Global Proficiency Framework这套国际最低熟练标准。每节有短讲解和脚手架练习。做错先给提示,再给完整解答。学生用自然语言对话,不是点按钮。底层用了NLP和LLM,用来读懂作答和开放提问。
试验放在该网络的11所学校,校际在地理、人口、课程和教法上相近。随机分到校级:6所对照、5所处理。学生层面随机做不到。处理组每周两次、每次30分钟,在自习课用Rori,老师在场只修设备。对照组同一时段继续常规数学。两边正课课程和课时相同。
试卷是同一套35题,覆盖该框架三到五年级的数感和代数,2023年2月初测、8月末测。基线637名三到八年级学生,两端都考的477人:对照241、处理236。流失160人,主因是出勤不稳。
增长分等于末测减初测。对照均值2.12分(SD 6.30),处理5.13分(SD 7.03),差3.01,独立样本t检验p<0.001。
| 组别 | 初测 | 末测 | 增长 |
| 对照 N=241 | 20.20 | 22.32 | 2.12 |
| 处理 N=237 | 20.29 | 25.42 | 5.13 |
效应量按Morris的办法,把两组两个时点的标准差池化,Cohen's d为0.36。教育干预里这算中到大:Hattie把0.29标成中等、接近好老师;Kraft把超过0.20 SD的干预当大。对照那2.12分可以看成常规课加重测,处理多出来的部分被写成大约一年或更多的学年进步。
初测分数、性别、年龄两组没有显著差异。流失学生初测更低(18.53对22.26),效应量只在考完全程的人上算,这个缺口不直接改d。论文把Rori的边际成本写成大约每生5美元,含LLM API、手机和3G流量。
这是把LLM家辅塞进低收入学校日常作息的实地数据,不是课堂外的演示。通道选WhatsApp,是因为电脑和宽带到不了、手机到得了。5美元和0.36 SD绑在一起,改课纲、缩班、高剂量真人家教在这个成本带里对不上。
增益里有多少来自自适应、多少来自自习课被换成了结构化练习,这篇拆不开。处理组并没有在放学后再加一小时,比较的是Rori自习对常规自习。
只有11所学校做校级随机,组间没测到的差异消不掉:校长老师因被观察更认真(霍桑效应),学生家庭背景也可能不均。该网络习惯常规测评,霍桑可能弱一些,但校级聚类标准误论文没报。
全年级共用偏易的卷子,高年级初测就满分,进步被压低;也可能Rori主要帮较容易的题。流失的160人更弱,报告样本偏能坚持来考试的学生。没有按使用时长做剂量曲线。只覆盖该网络第一年。表1处理组写237人,正文写236,差1人。