与 Tetlock 合著新预印本:RL 奖励评分规则如何塑造 LLM 预测能力
simonguozirui · x · 2026-09-03
Lightning Rod AI 与预测领域权威 Philip Tetlock、Ville Satopää 合作发布新预印本,研究如何训练 LLM 做事件预测:对同一个 LLM 做 5 个版本的后训练,只改变作为 RL 奖励的评分规则,结果聚合分数相近,但 BIN 剖面差异很大。
核心观点:
- 仅看 Brier 分数无法判断预测者能否区分「可能」与「不可能」事件
- BIN 框架把预测表现拆成 bias(系统性偏移)、information(真实信号)、noise(随机散布)
- 有的模型辨别力好但概率系统性偏高,有的模型靠贴基准率反而得分更高
结论:选择评分规则本身就是训练预测型 LLM 的关键一环,不同规则在准确性与错误类型间有不同的权衡。
「研究」频道最新
- 开源项目 Reef:让 Agent 从推理时信号持续自我进化 — pliang279 · 2026-09-03
- Google RecEvolve:自主 Agent 在生产推荐系统上跑出 NDCG 提升 20% — _reachsumit · 2026-09-03
- NeoMME 单塔多模态编码器:260M 参数在 ViDoRe v3 领跑 800M 以下模型 — _reachsumit · 2026-09-03
- Meta hLLM 用匈牙利算法一次解码完整排序,推理提速 64 倍至 28ms — _reachsumit · 2026-09-03
- DS-Frame 快慢思考框架:按用户难度路由推荐系统算力 — _reachsumit · 2026-09-03
- 斯坦福新基准:同一模型换框架,Agent 成绩相差 27 个百分点 — rohanpaul_ai · 2026-09-03