NTU 研究:harness 好坏取决于模型与任务组合,无通用最优
jiqizhixin · x · 2026-10-11
南洋理工大学 An Bo 团队发布论文《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》,系统研究 agent harness 与模型的交互效应。
- 覆盖 OpenHands、DSH、PI、openJiuwen 四个可配置 harness,并以 Codex–GPT、Claude Code–Claude 原生组合作参照
- 核心结论:harness 质量不是固定属性,而是取决于 harness、模型与任务的具体组合——同一模型换 harness 后,工具调用、上下文管理和错误恢复表现都会变化
- 在一个任务上表现突出的 harness 在另一个任务上可能失灵,不存在通用赢家;厂商原生 harness 也未必最适合自家模型
「编程与Agent」频道最新
- LangChain 创始人发问:企业内部 agent 的身份该用谁的凭证? — hwchase17 · 2026-10-11
- 全部 Science 论文嵌入免费开放,agent 可语义检索整个科学文献库 — IgorCarron · 2026-10-11
- 网友设计个人 AI 智能体架构:本地模型路由任务+人工审批敏感操作 — roamingandy · 2026-10-11
- Codex 疑似夜间故障,用户称所有智能体集体罢工拒绝干活 — burhop · 2026-10-11
- VC 创始人实测:100 个 Opus 智能体不比 10 个强,扩展性远逊预期 — zsakib_ · 2026-10-11
- $119 训练 Qwen 27B 做 Cypher agent,图查询准确率提升 6.2 分 — sophiamyang · 2026-10-11