研究:Harness 优化使 Qwen 在 SWE-bench 上解题数翻倍
rohanpaul_ai · x · 2026-08-31
这篇论文探讨了改变“Harness”(控制模型视野、工具使用及工作流的系统)对固定模型任务结果的影响。实验对比了保留完整历史与压缩旧输出/处理卡顿的配置。在 20k token 限制下,优化后的配置将 Qwen2.5-Coder 在 SWE-bench Verified 上的完整解决方案从 43 个提升到 72 个,F2PF 指标显著改善。这证明了工程架构对 Agent 性能的决定性作用。
所属事件:研究发现编程 Agent 性能高度依赖 Harness 上下文策略(2 条相关)→
「编程与Agent」频道最新
- 腾讯 ContextPilot:通过细粒度 RL 教智能体主动管理上下文 — tencent · 2026-08-31
- Agent 工作流小测验:依赖变更后如何决策? — Darkcraft00 · 2026-08-31
- WebMCP 协议为 AI Agent 与网站交互提供“VIP 通道” — thisiskp_ · 2026-08-31
- PDF 翻译器卡 70% 准确率:如何防止 LLM 乱改数字? — Nervous_Classroom714 · 2026-08-31
- 实战:测量 Windows 应用对 Agent 暴露的控件树 — Frequent-Ad-836 · 2026-08-31
- Rayrun 推出 sPTC 技术,AI 响应速度提升 20% — lucgagan · 2026-08-31