单轮测试全对,agent 一跑全崩:基准与真实 agent 循环的落差

Born-Woodpecker-4530 · reddit · 2026-09-24

Reddit 帖:作者精心调优过基准测试、成绩漂亮,但把真实 agent 循环接上后所有假设都崩了——prompt 随轮次不断膨胀、工具调用间隙 GPU 空转、单轮基准数字对实际表现毫无预测力。帖子点出了 agent 评估的核心痛点:单轮 benchmark 无法反映多轮状态膨胀、延迟与成本问题,楼主进一步征集大家在「从单轮到 agent 循环」跨越中遇到的意外。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →