实测用 Google Astra 构建RL标题评分函数:计划强不保证结果

博主 ivanbezdomny 在新闻项目的 RL 训练中,让 Google Astra 构建一个为新闻标题的语法可读性与人类偏好打分的评分函数,语料包含数千条由 GPT、Claude 及自研微调模型生成的标题与文章,评分将作为 RL 奖励信号。实测评价显示 Astra 的计划能力出色,能设计出合理的评分方案,但不保证最终输出结果可靠。

2026-09-06 ~ 2026-09-06 · 2 条相关