softmax 不是你想要的概率:两篇 LLM 输出校准论文受关注
joecole · x · 2026-09-24
- 随着 jev 的走红,如何度量 LLM 输出概率重新引发兴趣。alex dong 指出直接用 softmax prediction 并不是你想要的,并推荐两篇关于如何为 LLM 概率建立基础与校准的论文。
- 引用者 hxiao 补充:必须做校准才能让概率用于决策,并调侃「下次去 ICML/ICLR/NeurIPS 别再无视校准方向的 poster」。
「研究」频道最新
- OpenAI 联合 80+ 临床医生发布开源心理健康基准 MentalHealthBench — OpenAI · 2026-09-24
- MentalHealthBench 覆盖日常支持到危机干预的全谱系对话 — OpenAI · 2026-09-24
- Paperena 基准按完整科研周期评测 AI 科学家:写、审、改 — yeewhye · 2026-09-24
- ACL'23 杰出论文:判别式语言模型为何可能比自回归更泛化 — ysu_nlp · 2026-09-24
- 10 次重跑均到关键区域却无一复现发现:全自主 agent 脆弱性实录 — rohanpaul_ai · 2026-09-24
- GTSAM 4.3发布:腿足导航、CUDA加速因子图与连续时间轨迹估计 — fdellaert · 2026-09-24