决策模型 Jev 校准误差约 0.09:对得准但「自信度」仍失真
colinmcnamara · x · 2026-09-21
作者在两条 prompt 上、以人工标注为基准测得决策模型 Jev 的期望校准误差(ECE)约 0.09:情感任务上信心不足,新闻主题分类的顶部区间则过度自信。结论是它答对的次数不少,但对「自己有多确定」的估计仍然不准。
「模型」频道最新
- 博客解析 YOCO 与跨层 KV 共享,涉及 DeepSeek-V4.1-Flash 与 Gemma 4 — donglixp · 2026-09-21
- 曝 Gemini 4.0 在路上:Pro 一年一更,Flash 或月度迭代 — haider1 · 2026-09-21
- SemiAnalysis 创始人:中国多家实验室将转向闭源,开源正在消亡 — ns123abc · 2026-09-21
- DeepSeek 网页版文风被指遭安全对齐「脑叶切除」 — Old_Let6328 · 2026-09-21
- JEV 取消 waitlist 开放:5 美元额度、输入仅 0.042 美元且输出免费 — op7418 · 2026-09-21
- ChatGPT 20x Max 用户吐槽限额收紧:怀疑算力优先给了政府和 API — BopSupreme · 2026-09-21