掷骰子实验暴露 LLM 概率校准缺陷

有用户对 Jev 做校准测试,用真实概率已知的输入检验其不确定性判断:公平骰子 400 次试验中,Choice 模式每次都选 1 点,平均报告 82.9% 概率,实际准确率却只有约 19%。抛硬币测试同样暴露问题。讨论中 daamitt 指出,多数人还没意识到 Jev 问题的核心是「校准本身就是产品」——常见 demo 里错误决策没有代价,所以校准缺陷才被掩盖,模型学不会说「不知道」。

2026-09-24 ~ 2026-09-25 · 2 条相关