harness 影响模型表现:作者开启系列实测探究其机制
yb2698 · x · 2026-10-07
作者发起系列实验,探究不同 harness 与不同模型规模对模型性能和行为的影响。作者指出这是社区广泛已知的现象,近期也有多项工作提及,但值得系统量化验证——由此引出后续在 ALE benchmark 上对比 Qwen Code 与 Pi 两种 harness 的实测。
所属事件:研究者实测 agent harness:框架间工具高度重叠,system prompt 影响显著(6 条相关)→
「编程与Agent」频道最新
- Every 推出 Slack 上的 AI 员工,可写邮件、处理 Stripe 纠纷 — danshipper · 2026-10-08
- Perplexity 开源视觉检索模型,一行 pip 接入 sentence-transformers — antoine_chaffin · 2026-10-08
- PyTorch 核心开发者:类型系统好在她让你无需记得写那些测试 — ezyang · 2026-10-08
- 1 名工程师 6 个月用 AI 做出四端应用,AI 让工程师百倍化 — Yuchenj_UW · 2026-10-08
- Google Labs 发布 vibe code 项目分享平台,像 GitHub 之于程序员 — templecrash · 2026-10-08
- 用好编码 agent 的关键:别把所有事塞进一个线程 — msfeldstein · 2026-10-08