SAS类似无人工轨迹的过程监督
furongh · x · 2026-07-06
SAS 类似扩散语言模型上的过程监督,但不需要人工书写的推理轨迹。它不只奖励最终答案,而是对整个揭开(unmasking)轨迹给出稠密反馈,学到一种模型原生的课程:尽早确定有帮助的部分,推迟模糊的部分。
所属事件:SAS让扩散语言模型学会自感知调度(15 条相关)→
「研究」频道最新
- Google DeepMind 分享 Project Genie 的创作者协作幕后 — alexanderchen · 2026-07-21
- Nat Lambert 反驳 RL 蒸馏直接用最强模型当老师 — natolambert · 2026-07-21
- 线程称 GPT-5.6 Sol 帮忙构造出 Jacobian 猜想反例工厂 — LucaAmb · 2026-07-21
- TimeLens2 以 4B 和 8B 模型拿下 7 项视频定位 SOTA — _akhaliq · 2026-07-21
- 真实数学进展常靠推翻旧直觉 — LucaAmb · 2026-07-21
- EPO 用边缘对齐同时优化 3D 模型位姿与深度 — ducha_aiki · 2026-07-21