Allen AI开源TutorMoments基准,评估大模型辅导学生能力
allen_ai · x · 2026-08-08
Allen AI(Ai2)发布了 TutorMoments 基准测试,旨在衡量语言模型作为辅导老师的表现。该工具通过让被测模型与模拟学生互动,处理真实辅导记录中截取的关键时刻,并对生成的回复进行评分。
评估主要关注三个维度:
- 适当的支持 (Appropriate Scaffolding):在需要时提供降低难度的辅助,且不过度干预。
- 适当的严谨性 (Appropriate Rigor):在关键时刻适当提高认知要求。
- 避免过度辅导 (Avoids Over-Scaffolding):防止模型给予过多提示。
Ai2 同步开源了脱敏的辅导记录标注数据、评分代码及回放数据。他们发现,在提示词中明确说明何时该帮助、何时该保留,能有效提升所有测试模型的得分,但不同模型在做出可靠判断方面仍存在巨大差异。
所属事件:Allen AI 发布 TutorMoments 基准评估大模型辅导能力(3 条相关)→
「研究」频道最新
- 卡内基梅隆大学推出 AI4BIO 研究员计划,招募交叉学科人才 — jmuiuc · 2026-08-08
- 超两千页免费数学宝典:涵盖机器学习所需核心理论 — HankYeomans · 2026-08-08
- 让机器人从视频学技能,CD-LAM 去偏框架提升 12 倍效率 — jiqizhixin · 2026-08-08
- Gensyn 谈 AI 核心难题:如何在不信任设备上验证 AI 执行 — benfielding · 2026-08-08
- 优化奖励函数让机器人 RL 训练提速 5 倍 — carlosdponx · 2026-08-08
- 仅 8MB 的静态嵌入模型 Lattice:7 分钟跑完英文维基百科 — vanstriendaniel · 2026-08-08