RLHF 之后又有 RLCD:用强化学习让 LLM 的置信度可校准

prdeepakbabu · x · 2026-09-18

继 RLHF、RLAIF、RLFT 之后出现新缩写 RLCD(RL for calibrated decisions)。帖子介绍 Jev 系统采用这一架构,把生成视为多线程并行的极端分类以实现超快响应,并专门解决 LLM logits 通常不可校准的问题。作者关联的最近论文是慕尼黑工业大学等团队的《Rewarding Doubt》:基于对数评分规则设计奖励,直接微调 LLM 在回答事实问题时输出校准的置信度,同时惩罚过度自信与自信不足。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →