实测模型概率判断翻车:60/40 的硬币被说成 99/1
JnBrymn · x · 2026-09-19
开发者 JnBrymn 系统测试了名为 Jev 的模型的概率判断能力:对一个正面概率 60% 的不公平硬币,模型给出 99/1 的荒谬分布。他扫描所有正面概率取值后发现模型输出普遍失准;改用不同的提问方式(作为 noul 而非 choice 询问)后表现「至少正常了」,但已知精确答案的问题上最大误差仍达 9%。这揭示了模型在显式概率校准上的系统性弱点,以及提问措辞对输出的显著影响。
所属事件:实测新模型 Jev 概率判断:60/40 硬币被答成 99/1(2 条相关)→
「模型」频道最新
- RL 训练分类模型 Laya 登上 Hugging Face 趋势榜 — convaiinnovations · 2026-09-19
- GPT-Live API 新增多款语音,开发者 Playground 可试听 — juberti · 2026-09-19
- 曝 DeepSeek v4.1 flash 论文图:上下文扩到 1M token 质量陡增 — andrew_n_carr · 2026-09-19
- 踩坑警告:OpenAI Agents API 空闲容器让用户被扣 1600 美元 — Wide-Arugula3042 · 2026-09-19
- 基准显示模型能认出图像模式却总选错补全图,卡在结构推理 — AndrewDai · 2026-09-19
- 用户提前 4 天耗尽 Codex 用量额度:重档也扛不住,称 Astra 很贵 — NYCounihan · 2026-09-19