LLM 仍有自信校准问题
danshipper · x · 2026-07-20
这条在说 LLM 有明显的“自信问题”:当人们问它“某件改变人生的大事有多大概率发生”时,模型往往不能很好地表达不确定性,而是直接给出回答。
作者用一组“两张图的故事”来说明这个现象,核心意思是:模型的问题不只是能力,还包括置信度/校准。
「模型」频道最新
- NVIDIA 称 Nemotron 3 Ultra 在 2026 IMO 上拿到 30/42 — NVIDIAAI · 2026-07-22
- OpenAI 传将向美国政界简报下一代模型家族 — kimmonismus · 2026-07-22
- Muse Spark 1.1 在 Text Arena 跑到 1495 分,性价比很突出 — ycombinator · 2026-07-22
- 教授提醒:最先进的大模型正变得无法相互替代 — emollick · 2026-07-22
- 实测吐槽谷歌 Gemini 全家桶:无一款模型能胜任核心工作负载 — bindureddy · 2026-07-22
- 曝某模型支持百万 token 上下文,价格低至 $0.33 — MickeySteamboat · 2026-07-22