超细粒度程序生成助力长程任务后训练
开发者分享了一种用于长时程任务后训练的技巧——“超细粒度程序生成”。其流程是利用 pass@128 生成多个尝试,将失败样本分桶并生成极度细化的验证器,从而近乎准确地给长程工作流的不同部分分配信用,解决策略梯度算法难以处理的信用分配问题。作者称这一方法近乎“作弊”般有效,显著提升长程任务的训练效果。
2026-08-20 ~ 2026-08-20 · 2 条相关
- 技术技巧:超细粒度程序生成提升长程任务训练效果 — tokenbender · 2026-08-20
- 长时程后训练技巧:超细粒度程序生成与归因 — tokenbender · 2026-08-20