451 人真人对照实验:LLM 用户模拟器全是「好人」,虚高 Agent 成绩
niloofar_mire · x · 2026-09-11
- CMU 团队(周轩卉、Graham Neubig、Sherry Wu 等)发布论文《Mind the Sim2Real Gap in User Simulation for Agentic Tasks》,首次让 451 名真人按 τ-bench 协议完整跑 165 个任务,对照评测 31 个 LLM 模拟器,并提出量化指标 User-Sim Index(USI)。
- 关键发现:
- LLM 模拟的用户过度配合、风格单一、缺乏真实的挫败感与歧义,形成「简单模式」,把 Agent 成功率虚高到超过人类基线。
- 评估信号上,真人会在八个质量维度给出细腻反馈,模拟用户则清一色偏正面;基于规则的奖励机制根本接不住人类反馈的丰富信号。
- 通用模型能力更强并不意味着用户模拟更逼真。
- 该工作(Sim2Real gap 与 Osim)同时被 humansand 的博客引用——后者发布 Persimmon,称是首个大规模模拟真实人际对话与交互行为的模型,作者nlpxuhui 对「AI Agent 真实参与社会协作」表示期待。
「研究」频道最新
- 用 AI 智能体优化比特币椭圆曲线量子电路,ECDSA.fail 挑战论文上 arXiv — jedisct1 · 2026-09-11
- 博主反思 7 月以来 AI4math 进展:担忧难以排除的灰暗未来 — nanjiang_cs · 2026-09-11
- Pinokio 作者剖析数字溯源难题:哈希不够,判定"相同"是社会问题 — cocktailpeanut · 2026-09-11
- Trail of Bits 开源 trailmix 电路工具链,得分超越 Google 量子 ECC 白皮书 — jedisct1 · 2026-09-11
- Artificial Analysis 没被收买:自费 1.3 万美元实测各家模型 — Antblue · 2026-09-11
- Geoffrey Irving 自曝失败:数周尝试证明 Lean 内核完全正确未果 — geoffreyirving · 2026-09-11