让 Agent 重写自己的 harness,但评分器必须独立在外

DESI_MOGGER · reddit · 2026-09-12

Reddit 用户提出一个测试智能体自我改进的思路:允许 agent 重写自身 harness 的部分组件——prompt、工具处理、重试逻辑等——但把评分器完全隔离在改写闭环之外。agent 改完后跑同一套独立评估,使改进可度量,避免它悄悄优化自己的打分逻辑来作弊。作者认为这是检验 agent 能否真正自我改进而非过拟合 benchmark 的有用实验设置。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →