DeepSeek Harness 评测框架 Bug 致 Agent 陷入死循环,成本暴增三倍
teortaxesTex · x · 2026-08-14
BohuTANG 对 DeepSeek Harness (dsh) 进行评测时发现了一个严重的 Agent 策略 Bug:当 grep 零匹配返回退出码 1 时,dsh 会将其视为必须调查的失败。这导致 Agent 在测试已经通过后,依然不断创建并尝试修正额外的验证步骤,陷入死循环。
在相同任务、模型和推理配置下,该 Bug 导致了巨大的资源浪费:
- Requests: 61 次 vs 正常的 32 次
- 耗时: 10分38秒 vs 4分55秒
- 成本: $0.17 vs $0.05
- Input tokens: 290万 vs 54.8万
「编程与Agent」频道最新
- 仅用一句提示词,Grok 自动生成可玩糖果游戏 — Daniel_Farinax · 2026-08-14
- OpenMausBot 开源项目已获 800+ Star,强调无加密货币关联 — aigclink · 2026-08-14
- OpenMausBot:完全本地运行的开源版 Grok Bot — aigclink · 2026-08-14
- 实测Grok电脑操控Agent:像人一样操作旧软件 — yunta_tsai · 2026-08-14
- 微软开源 Orchard 智能体框架,统一软件工程与浏览器任务训练 — tom_doerr · 2026-08-14
- OpenAI 研究员揭秘内部 Codex 用法:多智能体像管理熟练团队 — JasonBotterill · 2026-08-14