掷骰子测出模型软肋:Jev 预测 83% 概率却只有 19% 准确率
kh-ai · reddit · 2026-09-25
作者对 Jev 做了校准测试,用真实概率已知的输入检验其不确定性判断:
- 公平骰子 400 次试验:Choice 模式每次都选 1 点,平均报告 82.9% 概率,实际准确率仅 19%
- 公平硬币:报告 92% 置信,实际对 52%
- Noul 在 2-4 选项时接近真实,但 8-20 选项时报告 15-17%(真实值 5-12.5%)
- 一份写着 30% 短缺风险的预测文档,Choice 判断为 5%,Noul 判断为 27%
关键洞察:MMLU 类考试考的是「模型知不知道问题难」,骰子测试考的是「模型知不知道结果从输入上就不可知」——Jev 明显弱于后者,尤其在 Choice 概率上。附完整 write-up 与代码数据。
所属事件:掷骰子实验暴露 LLM 概率校准缺陷(2 条相关)→
「模型」频道最新
- Vercel 网关数据:Anthropic 份额 69%→40%,被 OpenAI 蚕食 — ctjlewis · 2026-09-25
- Muse Spark 1.3 登陆 Google Cloud 与 Oracle,云合作再扩 — alexandr_wang · 2026-09-25
- Gemini 3.8 Flash 登 ARC-AGI-2 达 89.2%,单任务成本仅 $0.40 — fchollet · 2026-09-25
- Arena 改版榜单总览上线:聚合实时评测信号一站查看 — arena · 2026-09-25
- 开发者口碑:Opus 5.5 成最爱 Claude,比 Astra 更全面但数学略逊 — marcosalvi · 2026-09-25
- 提出用 Jev 类系统一模型打造 Bittensor 验证者的廉价决策层 — markjeffrey · 2026-09-25