超细粒度程序生成助力长程任务后训练

开发者分享了一种用于长时程任务后训练的技巧——“超细粒度程序生成”。其流程是利用 pass@128 生成多个尝试,将失败样本分桶并生成极度细化的验证器,从而近乎准确地给长程工作流的不同部分分配信用,解决策略梯度算法难以处理的信用分配问题。作者称这一方法近乎“作弊”般有效,显著提升长程任务的训练效果。

2026-08-20 ~ 2026-08-20 · 2 条相关