LLM教师九成插手,进度18%就开口,换题迁移近乎为零

AI Assistants Overassist

Verona Teo, Raghav Jain, Tobias Gerstenberg, Max Kleiman-Weiner

cs.LG, cs.AI, cs.CL, cs.CY, cs.HC

2026-07-23

四款LLM盯着Qwen2.5-7B解题:干预率90%、进度18%就出手,即时净增0.20,换同类题几乎不涨。

这篇在解决什么

AI 助教难在什么时候开口。这个取舍在教育里叫 assistance dilemma(援助困境):帮太早、给太满,学生少了自己挣扎;帮太晚,人又卡死。已有测量多停在下游,看成绩和投入感。助手在第几步开口、给的是提示还是答案、学生本来就会时还管不管,很少被分开记。

Int-Bench 用模拟把这三件事记下来。学生先独自写推理,教师分段看,每题最多插手一次。1500 题,代码纠错、数学、脑筋急转弯各 500,分别来自 DebugEval、MATH-500 和 Braingle。学生是 Qwen2.5-7B-Instruct,基线处于中段,还留着被拉高的空间。教师是 GPT-5.2、Gemini 3 Flash、GPT-OSS-120B、DeepSeek-V3.2。

方法

每轮先让学生独立作答,GPT-5.2 当裁判,温度 0。学生和教师温度 0.7,每题重复 3 次。学生取中等基线,是为了给干预留出上下空间。

Standard 每次多展示 50 个字符,教师选择等待或插手,最多一条消息。Oracle 同时看到全文、答案和对错,再指定一个出手点。用来看结局已知时,模型还会不会早早开口。

Continue 让学生接着写。Stop-and-Answer 要求读完消息马上作答,用的是 Standard 教师的那条消息。若第二种不比第一种差,消息已经把答案送出。

φ 是插手比例,并按原本对错分成 φcorrect、φincorrect。τrel 是出手位置占轨迹全长的比例。H 是插手回合上正确率变化的平均,每题 +1、0 或 -1。迁移用四步造题:标技能、聚类、换表面、丢掉不对题或错答案。每领域 150 道里留 100 对。新题分空白、只看原过程、看受助全过程三档,G 是后两档减去空白。

人类只做脑筋急转弯,免得领域知识主导差异。手选 30 题,轨迹与模型实验相同。Prolific 每条件 25 人,共 50 人,每人 6 题,同样 50 字符一揭。

结果

不受助正确率 43%:数学 70.4%,代码 45.2%,脑筋急转弯 14.4%。

三个领域合计,Standard 的 φ = 0.90,τrel = 0.18。GPT-5.2、GPT-OSS-120B、DeepSeek-V3.2 插手超过 90%;前两家常在不到 100 字符时开口,本来就会的题仍插手 98% 和 100%。Gemini 3 Flash 较少在学生做对时插手。

Oracle 降到 φ = 0.54(95% 区间 [0.52, 0.56]),对照 0.90([0.89, 0.90]),p < .001;τrel 从 0.18 到 0.56。本来就会时插手不到 3%。Gemini 3 Flash 两种条件下露出的字符差最小。

H 在 Standard 为 0.20:插手的回合里,25.5% 是错改对,5.4% 是对改错。Oracle 为 0.30,改错率 1.2%。

数学上,Stop-and-Answer 低于两种 Continue,后续推理还占一部分功劳。代码上 Stop-and-Answer 更高,H = 0.24,Standard-Continue 为 0.17。谜题上两者接近,0.27 对 0.30。代码和谜题可以读完就交卷。

迁移接近零。原题上下文的 G:数学 -0.01,代码 -0.03,谜题 +0.03。受助上下文四模型平均:-0.02、-0.04、+0.04。没有显著提升,数学和代码略降。

谜题上的人另算。Standard 下人 φ = 0.74、τrel = 0.74,LLM 为 0.94、0.24。Oracle 下人的 Δφ = +0.05、Δτrel = -0.11,模型的 Δφ = -0.23、Δτrel = +0.33。交互项在频率上 β = -2.60(95% 可信区间 [-3.40, -1.80]),时机 β = 0.45([0.36, 0.53])。6/30 道本来就会的题上,模型 φcorrect 由 0.72 降到 0.00,人是 0.37 与 0.40。这些题上 12 次人手里,4 次在肯定或确认,也有人标出中途错步。

Table 1 上,最常见的都是把学生从死路拽回。模型约 24% 重述问题;人约 13% 改局部、约 13% 指向证据,并会肯定正确推理(最高 6.7%),模型这一项为 0。完整解法,Standard 是 14.2% 对 5.4%,Oracle 是 10.2% 对 6.7%。近完整脚手架,模型 45.1% 与 51.2%,人 29.7% 与 14.3%。只拒绝错路:模型为 0,人是 7.2% 与 11.8%。

设定指标结果
LLM Standard,三领域φ / τrel0.90 / 0.18
LLM Oracle,三领域φ / τrel0.54 / 0.56
Standard 的 H净正确率变化0.20(改对 25.5%,改错 5.4%)
Oracle 的 H净正确率变化0.30(改错 1.2%)
受助后做新题G,数学 / 代码 / 谜题-0.02 / -0.04 / +0.04
谜题 Standard人 vs LLM 的 φ、τrel0.74、0.74 vs 0.94、0.24

为什么重要

用「这道题对了」给助教打分,会把这些模型看得偏高。开口约在轨迹 18% 处,H 只有 0.20;换同技能新题,G 落在正负 0.04 里。短期分数和换一道还能不能做,在这项测量里是分开的。

看见完整结局后,φ 从 0.90 降到 0.54,本来就会的题插手低于 3%。早开口的一大截,是信息不够时的习惯。输入框里刚出现几十个字符就弹出建议,采到的就是这套习惯。

更会做题的两个教师,GPT-5.2 和 GPT-OSS-120B,开口最早,做对了也要管。人在谜题里等到相对进度 0.74,更多用拒绝错路和局部修正。附录换过揭示步长,换过 Qwen3-32B 和 LLaMA-3.1-8B,也加过「非必要不插手」的提示。正文只说定性相近,没有另给数字。这篇没有给出新的训练方法。

局限与存疑

学生是 Qwen2.5-7B。接上消息后它改答案,测到的是上下文里怎么沿用反馈。认知负荷和情绪不在这项测量里。论文写明,模拟学生离真人学习者有多远,现在还不清楚。G 只覆盖立刻再做的一道相关题,没有隔天重测,也没有反复练习。下一题正确率几乎没动。说真人的长期学习因此变差,证据还差一截。

人类侧是 50 人、30 道谜题、每人 6 次。题从 Braingle 最受欢迎、也最容易的 500 道里来。数学和代码没有人类教师。谜题基线 14.4%,把解法说破很容易变成正的 H。

GPT-5.2 既是教师也是唯一裁判,论文没有换裁判的结果。Oracle 的出手点可以事后指定。信息会改变行为;在线助手能否提前知道结局,这里没有检验。每题至多一句,覆盖不了连续追问。变体题由模型改写,技能对齐没有人工一致率。G 接近零,可能掺着出题误差。

术语

原文与代码

社区讨论

相关论文

全部论文解读