Tinker 开源配方:用强化学习训练校准的未来事件预测模型
simonguozirui · x · 2026-09-05
Anthropic 的 Tinker 团队发布了一份 cookbook 配方,教用户训练能在给定参考信息的情况下预测事件概率的校准预测模型,方法是使用强化学习微调。
配方附带来自 ProphetArena 的现成数据集,用户可以直接上手跑通流程,也可以换成自己的数据集训练自定义的事件预测器。团队此前已发表过微调预测器的研究,这次是把研究流程整理成普通开发者可复现的实践材料。
所属事件:Thinking Machines 开源强化学习训练事件预测模型配方(2 条相关)→
「编程与Agent」频道最新
- 开发者晒 Astra 全流程造品:代码、剪辑、写帖全由 agent 完成 — daniel_mac8 · 2026-09-05
- 开源 astra-advisor:让 Astra 把任务委派给更小的模型省钱 — daniel_mac8 · 2026-09-05
- astra-advisor 上架 GitHub:Codex 插件动态调度子智能体 — daniel_mac8 · 2026-09-05
- MIT 论文 SwarmWorld:智能体群的价值在成果可积累 — rohanpaul_ai · 2026-09-05
- 研究者提出「延迟记忆投毒」:Agent 一条错误事实污染未来所有决策 — sierracatalina · 2026-09-05
- GPT-6 Astra 登顶 Terminal Bench 4.0,成本仅为第二名一半 — charliermarsh · 2026-09-05