DeepTutor 把辅导和出题接成闭环,TutorBench 整体质量比朴素家教高 10.8%

DeepTutor: Towards Agentic Personalized Tutoring

Bingxi Zhao, Jiahao Zhang, Xubin Ren, Zirui Guo, Tianzhe Chu, Yi Ma, Chao Huang

cs.CY, cs.AI, cs.CL

2026-04-11

DeepTutor 用一份带证据的共享学习者记忆,把辅导和出题接成闭环;自建 TutorBench 上整体质量比朴素家教高 10.8%。

这篇在解决什么

现在的 LLM 家教靠静态预训练知识,不会因人而异;辅导和出题又各做各的,中间没有共享的学习者模型。作者认为这两个毛病同源:系统对学生缺一个细粒度、随时间演化的模型,顶多记个粗技能清单,看不到学生到底卡在哪步推理。评测也有盲区,多数教育 benchmark 站在老师视角,把学生当通用接收者。DeepTutor 的解法是搭一个闭环:辅导里暴露的弱点直接决定下一题出什么,做题表现反过来再修学生模型。

方法

核心是两套流水线共享一份上下文。

静态知识接地(SKG):把源文档拆成原子内容单元,用知识图和稠密向量索引两套结构,倒数排名融合后得到检索语料。

动态个人记忆(DPM):中心是一棵「轨迹森林」(Trace Forest),每棵树记录一次完整辅导交互,三层节点,会话级输入与全局摘要、任务分解的中间规划、含工具输出的细粒度执行记录。通过 TraceToolkit 暴露 SearchTrace、ListTraces、ReadNodes。三个记忆 agent 据此产出三份画像:会话历史、有证据支撑的反复混淆点与知识缺口、引导后续交互的教学反思。

辅导流水线三段:个性化勘察(规划器把问题拆成元问题、跨知识库和轨迹森林取证)→ 分步引导求解(每个子目标用共享工具集,自我笔记提炼要点,分层压缩已完成的子目标,不够就重规划)→ 证据驱动的迭代写作(每个事实断言带可追溯引用)。

出题流水线两段:个性化 idea 生成(按学习者视角扫概念景观,产出候选 idea,评估器过滤成模板)→ critic 引导生成(每个模板产「题、答、解析」三元组,验证器做 LLM 校验 + 沙箱代码执行)。关键设计是验证器和生成器不共享推理链,必须独立验算,降低自证错误。闭环属性:每次交互后,新轨迹入森林,三个记忆 agent 并行更新画像。

结果

作者自建 TutorBench:30 个跨五学科知识库,每个库三种学习者档(初/中/高),共 90 个学生画像,拒采后 270 个交互任务。用 Gemini-3-Flash 做 simulator 和 tutor,Claude Sonnet 4.6 做判官。

系统整体质量
朴素家教3.53
CoT 家教3.52
ReAct 家教3.52
自我精修家教3.57
DeepTutor3.91 (+10.76%)

五大学科间整体质量只波动 0.16 分,说明增益不是某个学科撑起来的。在 45 个会话的人工偏好研究里,人和 LLM 的胜率在十个指标上高度相关(Pearson r=0.82)。消融显示:去 SKG 主要伤接地性,去 DPM 主要伤个性化:SKG 锚定「说什么」,DPM 决定「怎么因人而异」。

把求解流水线单独抽出来(关掉个性化)放到五个公开推理基准上,五个 backbone 家族平均相对涨 25.7%32.0%:Gemini-3-Flash 在 GAIA L1 从 43.4 到 56.6,LiveBench 从 70 到 96。

为什么重要

对做教育 AI 的人,这篇的两点可借鉴。一是闭环:不要让辅导和出题各干各的,用一份共享的、带证据的学习者记忆把两者接起来,弱点直接喂给出题。二是验证器与生成器隔离这个设计,在需要正确性的场景(尤其带计算的题)很实用。求解流水线单独拿到通用 agent 基准上的大涨,说明这套多阶段 pipeline 不只服务家教,作为一个通用 agentic 框架也有迁移价值。

局限与存疑

作者承认的硬伤:交互评测靠 LLM 学生模拟器和 rubric 评判,绕不开模拟与真实学生行为的差距;多阶段 pipeline 用更高推理成本换可控性和个性化,延迟和费用是代价。补充几点判断:TutorBench 的 270 个任务规模偏小,+10.76% 的相对提升绝对值不大(1-5 分制上约 0.38 分),统计显著性论文没给;整体质量 3.91/5 仍离「好家教」有距离。求解流水线在通用基准上的大涨,是在各 backbone 基础分都不高的设定下,且没有和专门为这些基准设计的 agent 框架对比,参考价值要打折。

术语

原文与代码

社区讨论

相关论文

全部论文解读