KnowSim: Evaluating Information Calibration in LLM Assistants with User Simulators that Learn
Yoonjoo Lee, Hyoungwook Jin, Tae Soo Kim, Shaoyang Zhang, Philippe Laban, Q. Vera Liao
cs.AI, cs.CL, cs.HC
2026-08-18
密歇根等提出KnowSim,用带先修边的知识图模拟用户学习,705场对齐人类73–74%;新手DeepSeek V4增益最高但过载大,专家侧Gemini 3.1 Pro校准最好。
RLHF 把助手往「一条回复塞满」推。医生和病人问同一句滤泡性淋巴瘤会不会转化成弥漫大 B 细胞淋巴瘤,医生能吞下症状、升级指征和影像协议;病人连先修概念都没有,第一轮认知负荷就超过容量,几乎学不到。真正要做的是校准:量、深度、顺序跟用户当前理解和认知容量对齐。
现有用户模拟器大多是行为替身,不维护知识状态。它们只能打一个聚合「好不好用」,量不出不同知识水平的人学到了多少,也看不出多轮里理解怎么变。LLM judge 还容易把「看起来很会教」当成真的会教。
KnowSim 把一道题的完整理解建成信息单元(Information Unit, IU)有向无环图:节点是自包含概念,边是先修关系。图由参考答案经 GPT-5.2 抽一次,之后所有条件共用。用户知识状态给每个 IU 打四档:unaware、struggling、partial、knowswell。
按水平初始化:新手 10%/10%/30%/50%(会 / 半懂 / 卡住 / 没听过),中级 55%/15%/20%/10%,高级 80%/10%/10%/0%,按拓扑序优先填底层先修。
每轮两步。用户消息由 Gemini-3-Flash 按当前状态生成:不会突然说出 unaware 的概念,struggling 会出错,knowswell 用得对;局部掌握密度还决定提问是明确、含糊还是 deferential(把判断交给对方)。助手回完后,一次 LLM 调用给每个 IU 打教学质量和用户参与度。状态更新是确定性规则:
结束跟学习进度走:≥80% IU 到 knowswell 算掌握;连续 5 轮里过载、零晋升、教学静默至少占两条就停;最多 15 轮。
三个指标直接从状态轨迹算,不靠 judge。Knowledge Gain 是各 IU 序数提升之和(0–3 档)。Delivery Calibration 是「讲了且被吸收」对「本轮可教集合」的 precision-recall 调和平均,惩罚重复、先修不够、讲了没吃进去。Cognitive Overload 是每轮负荷相对容量的平均,封顶为 1。
KnowChat 在 Prolific 收了 705 场(MATH 372、ExpertQA 333),四臂交叉:策略或基座模型 × MATH 竞赛五级题 / ExpertQA。人按 10 题预筛分成新手、中级、高级。MATH 有前测后测;两域都有 1–10 分主观评分。策略臂对比 Adaptive、Comprehensive、Socratic;模型臂是 GPT-5.4、Claude Opus 4.7、Gemini 3 Pro。
与人类 pairwise 排序的符号一致率:MathQA 27/37=73%(p=.003),ExpertQA 26/35=74%(p=.003)。新手最齐,MATH 13/13=100%,ExpertQA 10/12=83%。MATH 中级掉到 50%,跟抛硬币一样。按指标,IQ 和 CO 两边都稳(MATH 各 75%;ExpertQA IQ 80%、CO 79%),DC 最弱(67%/64%)。
共同指标 IQ 上,KnowSim 77%(p=.008)压过带静态画像的 ZS-CoT-Prof 73%、Zero-shot 68%、ZS-CoT 64%。全轮次概念 Jaccard 0.614,四家里最高;只看用户发言时 KnowSim 是 0.479,略低于 Zero-shot 的 0.487。模拟会话更长:MATH 上 KnowSim 均 9.1 轮,真人 8.6 轮。
9 个模型、每题三个水平、MATH 30 + ExpertQA 30,全部关掉 thinking:
| 模型 | KG | DC | CO↓ | IQ | 均秩 |
| Claude Opus 4.7 | 6.8 | 0.108 | 0.856 | 8.16 | 2.75 |
| Gemini 3.1 Pro | 6.4 | 0.099 | 0.833 | 8.24 | 3.50 |
| DeepSeek V4 | 7.2 | 0.108 | 0.890 | 7.26 | 4.00 |
总榜第一是 Claude Opus 4.7,校准 DC 最高。Gemini 3.1 Pro 的 IQ 最高、过载最低。DeepSeek V4 知识增益第一,过载排第 8,论文称之为 knowledge-dumping:猛灌吞吐量,把人讲懵。Gemini 3.1 Flash 增益 7.1 排第 2,过载 0.895 全场最高,跟高吞吐模型同一病。
拆开水平,最优模型对调。新手:DeepSeek V4 的 KG=15.5 最高,CO=0.945 倒数第二;Gemini 3.1 Pro 的 CO=0.875 最低、IQ=8.39 最高。专家侧反过来:Gemini 3.1 Pro 均秩 1.75、KG=0.7 最高、CO=0.873 接近最低;Claude Opus 4.7 在中级 IQ=8.39、高级 IQ=8.30 最高,但不是新手知识投递冠军。Llama-4-Maverick 三档 IQ 都垫底。
214,642 个被讲解 IU 的失败模式是单向的:新手 65% 够不着(先修挡住 37% + 过载浪费 28%),专家 89% 在重复已经会的。真正推进状态的,新手 11%,专家只有 3%。中级重复占 68%,欠吸收升到 10%,瓶颈变成讲得浅。
总榜把三种人平均掉了。教新手猛灌和给专家少复读,不是同一套能力。做教育、医疗、专业问答,要用目标用户的水平选模型。DeepSeek V4 适合能扛密度的人;怕过载就看 Gemini 3.1 Pro。指标可解释到「这一轮是先修没铺还是一次塞太多」。代码和 705 场数据按 CC BY-NC 4.0 放。这是评测基础设施的渐进改进,还没拿去当 RL 奖励。
作者自己列了几条。模拟器没有动机和情绪,高级用户会出现 KG 饱和;只有数学解题和 ExpertQA 两域;从开放对话反推个人初始知识状态仍然难;每轮多次 LLM 调用,扩模型数会贵。
读下来还有几处站不稳。9 个模型全关 thinking,跟线上带推理的用法可能对不上。MATH 中级对齐掉到随机,说明更懂的人打分维度已经超出知识获取,模拟器在那一档当不了代理。DC 和人类主观校准对不齐。IU 图抽一次就冻住,抽错会污染所有条件。用户生成和状态抽取都是 Gemini-3-Flash,和被测的 Gemini 系列可能有亲缘偏差;论文测 IQ rater 时查过 self-preference,主模拟器没有同等披露。真人验证用的是 Gemini 3 Pro,9 模型榜换成了 Gemini 3.1 Pro,两套数字不能直接对读。论文写明这是评测代理,不能替代真人研究。