与 Tetlock 合著新预印本:RL 奖励评分规则如何塑造 LLM 预测能力

simonguozirui · x · 2026-09-03

Lightning Rod AI 与预测领域权威 Philip Tetlock、Ville Satopää 合作发布新预印本,研究如何训练 LLM 做事件预测:对同一个 LLM 做 5 个版本的后训练,只改变作为 RL 奖励的评分规则,结果聚合分数相近,但 BIN 剖面差异很大。

核心观点:

结论:选择评分规则本身就是训练预测型 LLM 的关键一环,不同规则在准确性与错误类型间有不同的权衡。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →