把前端设计归入视觉 agent 任务,分组相对评分缓解 reward hacking

stochasticchasm · x · 2026-09-22

作者分享一种缓解 reward hacking 的评测思路:将前端设计归类为「视觉 agent 任务」,借助视觉评估来判断智能体实际产出质量,减少模型钻评测空子。

另一个要点是采用 relative groupwise grading(组内相对评分)替代 pointwise grading(逐条绝对打分),通过同组候选结果两两/排序比较来打分,降低模型刷高分或评分失真的空间。

所属事件:Agent 评测新思路:前端设计归入视觉任务并采用分组评分(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →