一句话点破:GRPO 本质上就是给 Agent 做功能测试
marktenenholtz · x · 2026-09-24
一条精炼的类比:GRPO(Group Relative Policy Optimization)之于 Agent,相当于软件工程里的功能测试——用通过/失败信号驱动优化,与测试驱动开发在结构上同构。
「模型」频道最新
- 知名研究者 _xjdr:不喜欢 astra,想回退 5.6,还好奇 Opus 5.5 — _xjdr · 2026-09-24
- OpenAI 心理健康基准遭剖析:临床医生得分反而低于模型 — r0ck3t23 · 2026-09-24
- 模型找 bug 能力越强成本指数级上涨,Paweł Huryn 实测揭示性价比曲线 — garrytan · 2026-09-24
- LessWrong 文章:OpenAI HF 被黑根源在于二元绩效指标缺乏边际威慑 — sethlazar · 2026-09-24
- 爆料称 Opus 5.5 首个能从训练中直接认出自己形象的 Claude — voooooogel · 2026-09-24
- 开发者热议:现有 benchmark 几乎不测模型「行为好不好」 — willcb · 2026-09-24