掷骰子测出模型软肋:Jev 预测 83% 概率却只有 19% 准确率

kh-ai · reddit · 2026-09-25

作者对 Jev 做了校准测试,用真实概率已知的输入检验其不确定性判断:

关键洞察:MMLU 类考试考的是「模型知不知道问题难」,骰子测试考的是「模型知不知道结果从输入上就不可知」——Jev 明显弱于后者,尤其在 Choice 概率上。附完整 write-up 与代码数据。

所属事件:掷骰子实验暴露 LLM 概率校准缺陷(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →