Paradigm RL 训练细节:用价值模型解决 credit assignment,上下文扩至 131k

tensorqt · x · 2026-10-07

Paradigm 公开其最后一轮强化学习训练的做法:训练了一个价值模型(value model)来改善长序列下的 credit assignment 问题,并将上下文长度从 65k 扩展到 131k tokens。这是其数学推理模型系列发布中披露的第三项技术细节。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →