DeepSeek Harness 评测框架 Bug 致 Agent 陷入死循环,成本暴增三倍

teortaxesTex · x · 2026-08-14

BohuTANG 对 DeepSeek Harness (dsh) 进行评测时发现了一个严重的 Agent 策略 Bug:当 grep 零匹配返回退出码 1 时,dsh 会将其视为必须调查的失败。这导致 Agent 在测试已经通过后,依然不断创建并尝试修正额外的验证步骤,陷入死循环。

在相同任务、模型和推理配置下,该 Bug 导致了巨大的资源浪费:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →