为 RL 训练做确定性奖励:作者用 Astra 构建标题可读性评分函数

ivan_bezdomny · x · 2026-09-06

博主 ivanbezdomny 分享其新闻项目的 RL 训练实践:他拥有数千条由 GPT、Claude 及自研微调模型生成的新闻标题与文章,需要为每条生成结果打分以作为 RL 奖励,但用 LLM 做两两比较成本高(N² 量级)且在线 judge 噪声大。

于是他让 GPT-6 Astra 构建一个确定性函数,专门为「标题读起来顺不顺、是否符合人类偏好」打分。此前模型在处理这类任务时容易卡在标题长度等表面特征上。他已有的评分函数经过数周 RL 训练与分析打磨,但在可读性维度上一直表现不佳,这次是针对该短板的新尝试。

所属事件:实测用 Google Astra 构建RL标题评分函数:计划强不保证结果(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →