长任务 agent 的失败更像环境问题而非提示词问题
Confident_Analysis89 · reddit · 2026-07-24
- 作者认为,agent 一旦跑到几个小时,很多失败就不再是“提示词写得不好”,而是更像环境问题:旧文档、从仓库里抄到坏模式、上下文越堆越满、校验不够、停止条件设计不好。
- 他们把真正的关键点称为 harness engineering:AGENTS.md 应该保持简短、只充当地图;重要规则要下沉到 lint 和运行时检查里,而不是全靠 prompt 记忆。
- 对 evaluator-agent 这类“规划器 / 生成器 / 评估器”拆分方案,作者仍然犹豫。一次实验里,这种拆分确实做出了一个能上线的应用,但核心功能是坏的,而且成本大约高了 20 倍。
- 目前的结论是:先用硬性检查和真实运行证据打底,只在常规测试无法判断的地方再加独立评估器。
「编程与Agent」频道最新
- 内部排行榜曝光,AI 编程系统的真实用法一览 — charlieholtz · 2026-07-24
- Sqemo MCP 让 schema agent 按团队规则确定性命名 — Aggressive-Video-508 · 2026-07-24
- Codex Linux 分支接入 ChatGPT Work Realtime 语音 — jxnlco · 2026-07-24
- 作者分享 Claude、Lovable MCP、OpenAI 的构建栈 — MyCreativeOwls · 2026-07-24
- Synopsys CEO 称 AI 芯片设计已到 L4,前端用上 6 到 8 个智能体 — Scobleizer · 2026-07-24
- MindLab 开源 Macaron-V1:基于 GLM-5.2 的持续学习模型家族 — 机器之心 · 2026-07-24