研究:Harness 调优把 Qwen3.6-27B 法律 Agent 通过率从 67% 拉到 85%
sarahookr · x · 2026-09-09
sarahookr 转发并评论一项 Agent 研究结论:很多人把 Agent 表现归功于底层模型,但研究表明 harness 只能「唤回」模型已有的能力,无法创造模型不具备的能力。
关键数据:在 Harvey 法律 Agent 基准上,Qwen3.6-27B 仅靠 harness 优化就把通过率从 67% 提升到 85%,再加上 post-training 才推到 88%。
作者用厨师做类比:既要最好的食材(模型),也要最好的烤箱(框架),整个技术栈都应被视为可优化的对象,而不是只盯着其中一环。
「编程与Agent」频道最新
- 用户实测:Google Astra 高推理档反而更省钱 — brandon_galang · 2026-09-09
- t3code 实测:一台手机管遍 Claude/Codex/Grok 编码会话 — kamalgupta09 · 2026-09-09
- 「无模型参与」MCP 检索层实测:编码 Agent 工具调用减少 28% — Cryvixx · 2026-09-09
- Lovable 首位工程师 Emil Ahlback 离职,与伙伴创立新公司 getenergy — emilahlback · 2026-09-09
- Agent 可观测性成痛点:多步调用后如何看清决策链 — ComparisonNew9425 · 2026-09-09
- aidenybai 看空 runtime MCP:Codex Computer Use 与 Playwright 已够用 — aidenybai · 2026-09-09