为 RL 训练做确定性奖励:作者用 Astra 构建标题可读性评分函数
ivan_bezdomny · x · 2026-09-06
博主 ivanbezdomny 分享其新闻项目的 RL 训练实践:他拥有数千条由 GPT、Claude 及自研微调模型生成的新闻标题与文章,需要为每条生成结果打分以作为 RL 奖励,但用 LLM 做两两比较成本高(N² 量级)且在线 judge 噪声大。
于是他让 GPT-6 Astra 构建一个确定性函数,专门为「标题读起来顺不顺、是否符合人类偏好」打分。此前模型在处理这类任务时容易卡在标题长度等表面特征上。他已有的评分函数经过数周 RL 训练与分析打磨,但在可读性维度上一直表现不佳,这次是针对该短板的新尝试。
所属事件:实测用 Google Astra 构建RL标题评分函数:计划强不保证结果(2 条相关)→
「编程与Agent」频道最新
- Hermes Agent 用 computer use 零打断完成应用商店截图设计 — Teknium · 2026-09-06
- 开发者给团队服务器内置 slopmeter,直览 AI 代码质量变化 — steipete · 2026-09-06
- AI 智能体走进多人游戏世界,用 WebMCP 玩现实版 Pen Fight — jason_mayes · 2026-09-06
- 新 Codex 压缩机制神似留言板,作者猜测诱导模型写“给其他 agent 的笔记” — mariofilhoml · 2026-09-06
- 开发者试验在侧边栏可视化 subagent 运行状态 — steipete · 2026-09-06
- Yacine 晒 vibe coding 翻车:Python 逐像素画图致地图卡顿 — yacineMTB · 2026-09-06