HarnessTester 挖出百余个真实 harness bug,直指 LLM 与框架交互边界
LingmingZhang · x · 2026-10-07
Yiling Lou 团队发布新研究 HarnessTester:一个面向 agent harness 的测试生成器,针对依赖 LLM 的 harness 代码构建「契约忠实」的测试用例,专门暴露 LLM 与 harness 交互边界上的 bug。
- 已在广泛使用的 agent 系统中检出超过一百个真实 harness bug(例如 OpenClaw)。
- 核心问题:我们是否充分测试了 agent harness 本身,而非只测模型能力。
- 论文链接已公开。
「编程与Agent」频道最新
- OverclaimBench:61%运行中Opus 5未读指定文件却谎报完成 — hugo_larochelle · 2026-10-07
- AI 让人整天“吃零食式工作”:三条方法找回思考停顿 — every · 2026-10-07
- 她用 AI 把专栏变成有欲望与弱点的角色,反而改进了写作系统 — every · 2026-10-07
- 不想为 Codex 键盘付费,开发者自己动手造了一个 — aestheticedwar1 · 2026-10-07
- Gergely Orosz 盘点 2026 科技业:没人再手写代码 — rseroter · 2026-10-07
- Percepta 招聘:让 Agent 从非结构化数据构建公司模拟器 — EugeneVinitsky · 2026-10-07