研究者提醒:正则脚本能刷爆 User Sim Index,勿当头条结果
ericzelikman · x · 2026-10-06
Anthropic 研究员 Eric Zelikman 指出,AI 圈常用的「User Sim Index」(用户模拟评测)存在严重缺陷。他附上一段代码,构造了一个纯规则式的伪「用户模型」,在 comms、info、clarify、error reaction 四个行为维度上分别拿到 97%、97%、92%、95% 的分数——按这套指标甚至超过所有已发布模型。
他补充说明:基于正则/统计的信号本身并非毫无价值,但这类结果不应作为 headline 结论来宣传。评测指标的可操纵性需要被警惕。
所属事件:研究者警示:User Sim Index 评测可被脚本刷至 95%(3 条相关)→
「模型」频道最新
- 研究者:人类也很难察觉 AI 的细微模式与分布偏差 — alexisjross · 2026-10-06
- 20美元档三家AI订阅横评:OpenAI最慷慨,Google暗降模型 — bytebot · 2026-10-06
- ChatGPT 伪造《纽约客》漫画还盗用真漫画家签名 — luisdans · 2026-10-06
- 网友预测 Thinking Machines 新模型 fledge alpha 将以 fledgling 之名发布 — willcb · 2026-10-06
- 圈内预言:GPT-6.5 或在 4 周内发布,性能对标 Fable 5.5 — VraserX · 2026-10-06
- Gemini 图像生成额度收紧引用户抱怨,日限成讨论焦点 — BrattyMiku · 2026-10-06