SAS类似无人工轨迹的过程监督

furongh · x · 2026-07-06

SAS 类似扩散语言模型上的过程监督,但不需要人工书写的推理轨迹。它不只奖励最终答案,而是对整个揭开(unmasking)轨迹给出稠密反馈,学到一种模型原生的课程:尽早确定有帮助的部分,推迟模糊的部分。

所属事件:SAS让扩散语言模型学会自感知调度(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →