研究者警告:User Sim Index 评测可被轻松刷到 95%
ericzelikman · x · 2026-10-06
ericzelikman 指出业内常用的「User Sim Index」(用户模拟器评测)不应继续使用:他附带代码实现了一个「用户模型」,在沟通、信息量、澄清追问、错误反应四个行为维度上分别拿到 97%、97%、92%、95% 的高分——他认为这已超过任何已发布模型,但显然说明该基准无法反映真实用户模拟质量,存在被刷分的问题。
所属事件:研究者警示:User Sim Index 评测可被脚本刷至 95%(3 条相关)→
「研究」频道最新
- 用户模型评测为何难做:斯坦福研究者转向多用户图灵测试 — alexisjross · 2026-10-06
- 神经网络嵌入全部字体,Google Fonts 语料竟排出花朵结构 — Chroma-Crash · 2026-10-06
- Crawler Zoo 推出免费本地模型 agent 对战竞技场 — Time_Instruction_955 · 2026-10-06
- 8K 上下文小模型靠自我调用工具追平 GPT-5.4 百万级上下文 — xennygrimmato_ · 2026-10-06
- 用OpenAI Dots智能体集群免费打破47年数学纪录 — jaxchang · 2026-10-06
- 斯坦福教授批虚拟细胞研究:现有实验设计撑不起因果模型 — anshulkundaje · 2026-10-06