LLM 当概率分类器不够,研究者提醒需校准才能用于决策
PMinervini · x · 2026-09-23
@tinkerapi 提出 LLM 的 next-token 预测本身就是概率分类器,开源 LLM 可充当 Jev 式接口(离散输入、快速输出概率),并称用 Tinker 花 5 美元、10 分钟就能提升这一能力。@hxiao 引用反驳:仅靠 next-token 概率并不足以支撑决策,必须做校准(calibration)才有用,建议下次参加 ICML/ICLR/NeurIPS 时别错过校准方向的海报。
「模型」频道最新
- 模型发布疲劳:开发者称新模型提升边际化,够用就好 — Rasmic · 2026-09-23
- 评测者补充:Opus 5.5 与 Astra、Fable 5.1 大致同一档,无明确胜者 — AaronBergman18 · 2026-09-23
- 评测者称 Opus 5.5 综合或为最聪明模型,知识面略逊于对手 — AaronBergman18 · 2026-09-23
- 阿里连发五款 Qwen-Audio-3.1 语音模型,ASR 直降 95% — aigclink · 2026-09-23
- 46,000 字符纯数学代码生成短片,用户盛赞 Opus 5.5 是硅基最强艺术家 — RileyRalmuto · 2026-09-23
- GPT-6 Sol/Luna 价格砍半:$2/$10 与 $0.10/$0.50,智能分数持平 GPT-5.6 — burny_tech · 2026-09-23