StudentSim:用真实学生记录训练LLM学生模拟器,反超GPT-5.4
青稞AI · wechat · 2026-09-05
青稞AI详解论文 StudentSim:把教育场景的用户模拟器具体化为可训练、可评估的 per-student feedback model,输入学生画像、问题、初始回答与教师指导,输出学生可能的修正回答。
核心难点
- 学生模拟比普通 user simulation 多一层学习状态:知识边界、错误模式、受指导后的变化。
- 直接 prompt LLM 扮演差生存在认知保真问题:语气可模仿,但推理常远超目标学生水平,会高估学生吸收能力。
- 传统知识追踪模型又无法处理自然语言教学指导。
方法
- 两个评估目标:behavioral fidelity(像不像目标学生独立作答)与 guidance responsiveness(读入指导后是否朝目标更新)。
- 两阶段训练:Stage 1 用同领域多学生记录训练领域级 base simulator;Stage 2 用单个学生记录做个性化适配,应对 per-student 数据稀疏。
结果
- StudentSimEval 覆盖国际象棋、二语写作、基础数学三领域共 60 名真实学生。国际象棋上 StudentSim 的 F 为 0.5150(Maia2 0.4535、GPT-5.4 0.2316),R 为 0.9067(GPT-5.4 0.7186、Maia2 0.2721),三项领域均超基线。
- 下游 tutor RL 验证(国际象棋 + Stockfish reward):用 StudentSim 作 reward 训练的 tutor 在专家盲评中 accuracy 90.5%、guidance 3.31、personalization 3.93,均高于 SFT tutor 与 GPT-5.4 reward 版本,说明学生模拟器质量直接影响 tutor RL 信号。
「编程与Agent」频道最新
- 7 个开源爬虫项目盘点:自适应抓取到 AI 驱动提取一应俱全 — JafarNajafov · 2026-09-22
- 观点:若 Agent 能代劳,外卖电商等 App 将被原生替代品颠覆 — vaibhavbetter · 2026-09-22
- 哪些决策永远不该交给 AI Agent 自主执行?退款是个好例子 — ConvertMyStore · 2026-09-22
- Obsidian Starter Kit v4 发布:375 个 AI 技能把笔记库变成智能体基地 — dSebastien · 2026-09-22
- AI Engineer 演讲全索引上线:1183 场演讲带逐条时间戳速览 — strickvl · 2026-09-22
- 5.9 万次请求实测:模型路由只升不降,省钱靠的是缓存 — mrtrly · 2026-09-22