User Sim Index 可被平凡策略刷分,固定答案即达 95% 高分
ericzelikman · x · 2026-10-06
研究者 ericzelikman 指出,业界常用「User Sim Index」(USI)评测用户模拟模型并不靠谱。他附上代码,展示一个硬编码的「用户模型」在其四个行为维度上拿下 95% 总分:沟通 97%、信息 97%、澄清 92%、错误反应 95%,声称这超过任何已发布模型。
补充发现:USI 还包含一个较少被报道的「survey-alignment score」,原论文最高分为 78.3%——只要永远返回倒数第二个选项,就能超过或追平这一成绩,说明该指标极易被平凡策略攻破,不适合作为用户模拟能力的评价标准。
所属事件:研究者警示:User Sim Index 评测可被脚本刷至 95%(3 条相关)→
「模型」频道最新
- 用户吐槽:LLM 长对话线程中完全没有时间流逝概念 — dumierhan · 2026-10-06
- Reflection AI 新模型用 24T tokens 预训练,多模态版将至 — nagpalchirag · 2026-10-06
- 用户实测:Opus 5.5 上下文窗口消耗速度很快 — rickasaurus · 2026-10-06
- 两张刷屏对比图的陷阱:Claude「5 倍价值」其实是贵出来的 — jdjohnson · 2026-10-06
- 爆料称智谱将推开源 GLM 5.5,博主预测性能或超 Opus — bindureddy · 2026-10-06
- Liquid AI 发布 d1 视觉版:决策模型成本仅为大模型 1/19 至 1/200 — JosephJacks_ · 2026-10-06