Tinker 开源配方:用强化学习训练校准的未来事件预测模型

simonguozirui · x · 2026-09-05

Anthropic 的 Tinker 团队发布了一份 cookbook 配方,教用户训练能在给定参考信息的情况下预测事件概率的校准预测模型,方法是使用强化学习微调。

配方附带来自 ProphetArena 的现成数据集,用户可以直接上手跑通流程,也可以换成自己的数据集训练自定义的事件预测器。团队此前已发表过微调预测器的研究,这次是把研究流程整理成普通开发者可复现的实践材料。

所属事件:Thinking Machines 开源强化学习训练事件预测模型配方(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →