实测多模型运行餐厅:长寿命 Agent 失败的三大通病
EdwardCHWang · reddit · 2026-08-05
一位开发者在模拟餐厅经营游戏中测试了 GPT-5.6、Opus 5 和 minimax-M3 等多个模型驱动的 Agent。
- 主要错误:在记录了 2620 次被拒绝的 API 调用后,发现 86% 的错误源于三个问题:猜测不存在的端点(48%)、耗尽每日动作预算(20%)以及对已失效的 ID 执行操作(17%)。
- 修复与反馈:开发者增加了缺失的端点并在报错中提示剩余预算。动作预算超限问题得到缓解(20%降至7%),但乱猜端点的情况反而加剧(48%升至61%)。
- 跨模型通病:即使使用不同的模型和 Harness(如 Claude Code),这些核心错误模式依然惊人地一致。开发者呼吁社区探讨如何处理长寿命 Agent 中已被环境废弃的引用问题。
「编程与Agent」频道最新
- FastPlaid 1.6.0 发布:大幅提升内存效率与查询性能 — antoine_chaffin · 2026-08-05
- PAST-Bench:智能体记忆能力评测基准发布 — alifcoder · 2026-08-05
- AI辅助应用如何测试与部署?免费实战训练营 — Al_Grigor · 2026-08-05
- Dual SAM3 + 接缝遮罩:4K 全景 3DGS 重建工作流 — janusch_patas · 2026-08-05
- 利用大模型输出指导小模型:上下文蒸馏与 Agent 编排模式 — daniel_mac8 · 2026-08-05
- Hermes Desktop 结合 ComfyUI 实战:让 AI 自动修复工作流报错 — Birdinhandandbush · 2026-08-05