EMNLP 26 论文:KnowSim 评估 LLM 信息校准度
QVeraLiao · x · 2026-08-26
EMNLP 2026 收录论文提出 KnowSim,一个能模拟用户知识水平变化的评估框架。
- 核心问题:现有用户模拟器缺乏对知识状态的显式建模,无法评估 AI 是否根据用户水平(新手 vs 专家)校准信息输出。
- 解决方案:KnowSim 维护基于认知科学理论的知识状态图,计算知识增益、交付校准度和认知过载三项指标。
- 实验结果:在 705 次人机会话中,其排名与人类判断高度一致(73-74%);应用于 9 个 LLM 测试发现,最佳模型随用户知识水平不同而变化,揭示了标准评估无法发现的交互效应。
「研究」频道最新
- NeurIPS 机制可解释性研讨会征稿截止延期 — ninamiolane · 2026-08-26
- NeurIPS Findings 轨道截稿延期至 9 月 7 日 — ninamiolane · 2026-08-26
- 非营利组织 Sophron Research 成立,专注 AI 评估 — ryan_t_lowe · 2026-08-26
- NeurIPS 征稿:聚焦智能体行为的以人为本解释 — mdredze · 2026-08-26
- 推理模型通过“失败恢复”机制超越非推理模型 — Jeande_d · 2026-08-26
- 研究称推理模型强化行为与正确性关联弱 — Jeande_d · 2026-08-26