把前端设计归入视觉 agent 任务,分组相对评分缓解 reward hacking
stochasticchasm · x · 2026-09-22
作者分享一种缓解 reward hacking 的评测思路:将前端设计归类为「视觉 agent 任务」,借助视觉评估来判断智能体实际产出质量,减少模型钻评测空子。
另一个要点是采用 relative groupwise grading(组内相对评分)替代 pointwise grading(逐条绝对打分),通过同组候选结果两两/排序比较来打分,降低模型刷高分或评分失真的空间。
所属事件:Agent 评测新思路:前端设计归入视觉任务并采用分组评分(2 条相关)→
「编程与Agent」频道最新
- 吴恩达团队开源 OpenWorker:本地运行的桌面 AI 同事 — tom_doerr · 2026-09-22
- 可穿戴吊坠+语音转写:开发者畅谈无屏幕 AI 工作流 — EricBuess · 2026-09-22
- 开源 Office 引擎 Univer 发布 Office Harness,为 AI Agent 提供共享办公运行时 — Aiden_Tech_Ai · 2026-09-22
- Jev Workflows 0.3 RC 开源:Codex 插件管决策、诊断失败、核验完成度 — BLUECOW009 · 2026-09-22
- 开源 MCP 服务器可搜 npm 包、查体积并扫描安全漏洞 — modelcontextprotocol · 2026-09-22
- 无人监督的 AI 写代码会爆炸:边界案例组合爆炸拖慢开发 — alex_frantic · 2026-09-22