用户模型评测为何难做:斯坦福研究者转向多用户图灵测试
alexisjross · x · 2026-10-06
AI 研究者 alexisjross 借 ELIZA 案例讨论用户模型(user model)评测的两难:
1) ELIZA 案例表明,即便是人类也不擅长判断「模拟用户的模型」是否像真人——人类本身就是糟糕的判别器。
2) 衡量用户模型的整体行为固然重要,但现有评测都要求预先定义评估维度,而既然人类都不清楚「哪些特征让人像人」,预先设定维度就更不可靠。
因此她的团队选择「多用户图灵测试(MTT)」作为核心评测:用 LM judge 判别,不预设任何关于好用户模型的先验,而是让 judge 基于真实用户与模拟用户的上下文示例自行推理最相关的行为特征。Noah Goodman 补充说下周恰好在斯坦福「Minds and Machines」课上讲 ELIZA。
「研究」频道最新
- 泛癌肿瘤检测分割模型获 MICCAI FLARE 2026 最佳精度奖 — joonasvirtanen · 2026-10-06
- Elad Gil 感叹生物学进展缓慢,上一次高光还是 2012 年 CRISPR — dr_alphalyrae · 2026-10-06
- Prime Intellect COLM 期间办研究聚会,招长程 Agent 与 RL 研究员 — willcb · 2026-10-06
- COLM 2026 论文 SkillFoundry:从异构科学资源自进化 Agent 技能库 — jmuiuc · 2026-10-06
- EgoTools 基准:AI 仍难理解人类为何选工具,8B 微调反超开源 — liuziwei7 · 2026-10-06
- COLM 2026 演讲 INSIDE:模拟学习者的思维而非行为 — alexisjross · 2026-10-06