Eval 发现 agent 出错后,变更该在哪评审?开发者征集真实工作流
Afraid_Aardvark4269 · reddit · 2026-10-07
一位开发者在 Reddit 上提问:当 traces/evals 显示 agent 出问题(用错工具、跳过检索、漏升级、违反内部策略)时,团队在哪里评审拟议的行为变更——PR review、eval 仪表盘、事故复盘、prompt 版本工具,还是临时文档?
他正在做一个开源的「agent 变更提案」artifact,想在过度设计 schema 前了解真实工作流,征求反馈:
- 可移植的提案文件是真有用还是额外仪式
- 什么证据能让变更提案可信到值得评审
- 应包含哪些字段:观察行为、结果信号、trace 证据、风险、验证标准、回滚、负责人、置信度
- 现有工具/流程是否已解决此问题
「编程与Agent」频道最新
- 87% 被利用漏洞当天即遭攻击,Mandia 主张 agent 集群全天候防守 — a16z · 2026-10-07
- Claude Max $250 GitHub 额度倒计时 2 天,附一键薅完的 prompt — doodlestein · 2026-10-07
- 用 Codex 搭出 3D 飞行仿真,带深度缓冲与信号搜寻玩法 — MikePFrank · 2026-10-07
- FIXME:手机上圈个 bug,编码 Agent 通过 MCP 拿到全部上下文 — ZotZot69 · 2026-10-07
- 一首打油诗吐槽 MCP 灵魂拷问:每次工具调用都要重新认证一遍 — tdhopper · 2026-10-07
- 单人开发者做出首个通关 Minecraft 的 AI,胜 97% 人类玩家 — julianweisser · 2026-10-07