研究者争论:真正该比较的或许是 harness 不是模型本体
srush_nlp · x · 2026-07-23
这段讨论的核心不是“harness 是否能提升泛化”这么简单,而是:把 harness 本身当成模型的一部分,会不会改变我们比较模型能力的基准。
回复里强调了几件事:
- Base Transformer 本身没有工具,所以真正该比的是带 harness 的系统和裸模型。
- 在一些任务上,代码工具带来的提升很明显。
- 但在另一些任务上,工具收益并不那么清晰,因为“切块处理、再对切块行动”并不是 LM 程序独有的能力;理论上也可以设想把这类行为写进模型权重。
- 因而这条讨论的重点是:代码/工具 harness 作为系统组件的作用,而不只是底层语言模型。
所属事件:研究者争论:大模型泛化能力究竟来自模型本体还是 harness(8 条相关)→
「编程与Agent」频道最新
- Compound Engineering v3.20 把多模型分工带进编码流程 — iamrobotbear · 2026-07-23
- 有人把 ChatGPT Work 通过 Cloudflare 中继接成了 SSH 远程机 — nickbaumann_ · 2026-07-23
- 一个多智能体实验开放公共房间,支持 agent 互相交流 — tekbog · 2026-07-23
- AI 智能体复现 168 篇 ICML 论文,仅 7 篇完全经得起考验 — ChenhaoTan · 2026-07-23
- Grok 仅靠 CLI 就在 Unity 里做出天空海洋视频 — Daniel_Farinax · 2026-07-23
- 公开实验让 agent 进房间做通信研究 — tekbog · 2026-07-23