做了一年的个人 agent,最后输给一天新的版本
Antony_Richards · reddit · 2026-07-23
- 作者花了将近一年做个人助手 agent,最后仍然无法仅凭日常使用判断它到底“好不好”。
- 现成 benchmark 和让桌面模型上传工作区文件来打分,都没能解决问题;agent 会记住成功、淡化失败,而且模型切换、记忆失效、工具变更都会让表现漂移。
- 最有效的方法不是给它一个“终测分数”,而是不断写它没见过的新测试,更像给系统测“心跳”而不是做静态认证。
- 文中提到,一个做了一年的 agent,最后在某个类别上输给了一个只做了一天的新 agent,这才把改进方向暴露出来。
- 作者最后抛出问题:大家到底怎么判断 agent 真的变好了,是自己测、别人测,还是只能等它出错?
「编程与Agent」频道最新
- PyTorch 站台 AMD AI DevMaster 黑客松,奖池 3 万美元 — PyTorch · 2026-07-23
- Warp 的工厂主管 Agent 先自我介绍再开工 — vikvang1 · 2026-07-23
- Forrester:agentic AI 落地先看集成,不再只看模型 — rseroter · 2026-07-23
- 本地开源 agent 在 GAIA Level 1 上以 37 比 31 赢 Hermes — kimmonismus · 2026-07-23
- DWN.BRIDGE 本地 AI 代理曾可越界读取工作区外文件 — dwn270787 · 2026-07-23
- Claude Code 2.1.218 更新了 CLI、MCP 和无障碍支持 — ClaudeCodeLog · 2026-07-23