单轮测试全对,agent 一跑全崩:基准与真实 agent 循环的落差
Born-Woodpecker-4530 · reddit · 2026-09-24
Reddit 帖:作者精心调优过基准测试、成绩漂亮,但把真实 agent 循环接上后所有假设都崩了——prompt 随轮次不断膨胀、工具调用间隙 GPU 空转、单轮基准数字对实际表现毫无预测力。帖子点出了 agent 评估的核心痛点:单轮 benchmark 无法反映多轮状态膨胀、延迟与成本问题,楼主进一步征集大家在「从单轮到 agent 循环」跨越中遇到的意外。
「编程与Agent」频道最新
- 开发者用 RGBA 四通道写四层深度,近似渲染流体液面 — Michael_Moroz_ · 2026-09-24
- 一文讲透上下文压缩:长对话为何爆窗口、摘要如何瘦身上下文 — blaizedsouza · 2026-09-24
- 开发者图文详解:如何用 Jev 搭建带决策层的 Agent Harness — blaizedsouza · 2026-09-24
- Salesforce 论文:最干净的公开 RL 环境库仅 35.8% 通过审计 — dair_ai · 2026-09-24
- 开源项目 Pipelex:用 .mthds 文件声明式编排 AI 工作流 — tom_doerr · 2026-09-24
- 用户吐槽 Codex 应用内浏览器不支持 passkeys 登录 — madhavsinghal_ · 2026-09-24