用户模型评测为何难做:斯坦福研究者转向多用户图灵测试

alexisjross · x · 2026-10-06

AI 研究者 alexisjross 借 ELIZA 案例讨论用户模型(user model)评测的两难:

1) ELIZA 案例表明,即便是人类也不擅长判断「模拟用户的模型」是否像真人——人类本身就是糟糕的判别器。

2) 衡量用户模型的整体行为固然重要,但现有评测都要求预先定义评估维度,而既然人类都不清楚「哪些特征让人像人」,预先设定维度就更不可靠。

因此她的团队选择「多用户图灵测试(MTT)」作为核心评测:用 LM judge 判别,不预设任何关于好用户模型的先验,而是让 judge 基于真实用户与模拟用户的上下文示例自行推理最相关的行为特征。Noah Goodman 补充说下周恰好在斯坦福「Minds and Machines」课上讲 ELIZA。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →