RLHF 之后又有 RLCD:用强化学习让 LLM 的置信度可校准
prdeepakbabu · x · 2026-09-18
继 RLHF、RLAIF、RLFT 之后出现新缩写 RLCD(RL for calibrated decisions)。帖子介绍 Jev 系统采用这一架构,把生成视为多线程并行的极端分类以实现超快响应,并专门解决 LLM logits 通常不可校准的问题。作者关联的最近论文是慕尼黑工业大学等团队的《Rewarding Doubt》:基于对数评分规则设计奖励,直接微调 LLM 在回答事实问题时输出校准的置信度,同时惩罚过度自信与自信不足。
「研究」频道最新
- Index预训练让人形模型零样本成功率从8%跃升至56% — coreylynch · 2026-09-18
- 用「人生日记」评测持续学习:LLM 能记住一个人的一生吗 — JohnnyNi13 · 2026-09-18
- 预训练人类行为数据让任务成功率从 9% 飙至 56%,提升超 6 倍 — Dr_Singularity · 2026-09-18
- Index 预训练让 Helix 2.5 零样本成功率从 8% 跃升至 56% — coreylynch · 2026-09-18
- LLM 文本很强、表格很烂:作者认为是信息供给不足而非数据稀缺 — FamiliarSlide7685 · 2026-09-18
- IFM 发布 K2-Horizon-7B:扩散加速 LLM 号称无损跑至 5200 tps — Zulfiqaar · 2026-09-18