Paradigm RL 训练细节:用价值模型解决 credit assignment,上下文扩至 131k
tensorqt · x · 2026-10-07
Paradigm 公开其最后一轮强化学习训练的做法:训练了一个价值模型(value model)来改善长序列下的 credit assignment 问题,并将上下文长度从 65k 扩展到 131k tokens。这是其数学推理模型系列发布中披露的第三项技术细节。
「研究」频道最新
- 研究者提出 World Editing:不生成新世界而是编辑已有世界 — yuntiandeng · 2026-10-07
- 新研究追问:Agent 替你行动时,它到底站在谁那边 — ZacharyHuang12 · 2026-10-07
- RL 研究年度 Top 10 榜单出炉,Spurious Rewards 居首 — ShayneRedford · 2026-10-07
- SciConBench 团队:每两月跑一轮评测,寻找资金维持公开榜单 — manoelribeiro · 2026-10-07
- 动态基准 SciConBench:AI 合成医学结论 61–90% 含事实错误 — manoelribeiro · 2026-10-07
- SciConHarness 屏蔽答案来源,逼模型真合成而非检索 — manoelribeiro · 2026-10-07