Allen AI开源TutorMoments基准,评估大模型辅导学生能力

allen_ai · x · 2026-08-08

Allen AI(Ai2)发布了 TutorMoments 基准测试,旨在衡量语言模型作为辅导老师的表现。该工具通过让被测模型与模拟学生互动,处理真实辅导记录中截取的关键时刻,并对生成的回复进行评分。

评估主要关注三个维度:

Ai2 同步开源了脱敏的辅导记录标注数据、评分代码及回放数据。他们发现,在提示词中明确说明何时该帮助、何时该保留,能有效提升所有测试模型的得分,但不同模型在做出可靠判断方面仍存在巨大差异。

所属事件:Allen AI 发布 TutorMoments 基准评估大模型辅导能力(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →