让 Agent 重写自己的 harness,但评分器必须独立在外
DESI_MOGGER · reddit · 2026-09-12
Reddit 用户提出一个测试智能体自我改进的思路:允许 agent 重写自身 harness 的部分组件——prompt、工具处理、重试逻辑等——但把评分器完全隔离在改写闭环之外。agent 改完后跑同一套独立评估,使改进可度量,避免它悄悄优化自己的打分逻辑来作弊。作者认为这是检验 agent 能否真正自我改进而非过拟合 benchmark 的有用实验设置。
「编程与Agent」频道最新
- check_vitals MCP 工具:给 agent 提供 CrUX 真实性能数据 — atp_studio_coll · 2026-09-13
- Stripe 推出 Link CLI:一次集成给你的 Agent 加上付款钱包 — jeff_weinstein · 2026-09-13
- 编码 Agent 会自创形式语言,自然语言或成其元语言 — jmugan · 2026-09-13
- Uncle Bob 发文质疑 Agent Harness 设计,呼吁重新思考 — blaizedsouza · 2026-09-13
- 毒事件隔离清单:坏消息不再阻塞整条队列的 6 步实践 — blaizedsouza · 2026-09-12
- Agent 别自己调所有下游系统:一条事件、多个消费者的扇出模式 — blaizedsouza · 2026-09-12