研究者争论:真正带来提升的是提示拆解还是逐 token 输入

a1zhang · x · 2026-07-23

这条回复在争论一个评测实验到底说明了什么。

作者的核心观点是:实验并没有证明原始 LLM “必须依赖 token-by-token 输入”,而更像是在说明一个带有 prompt shaping / 任务拆解 的 harness 会显著提升效果。

他认为,单个 LLM 在训练中见过的 prompt 上表现更好是显而易见的;真正值得问的是,这种 harness 的拆解是否“必要”。他的判断是:实验表明它很有价值,但未必能严格推出“必要”。他还把与 base Transformer 的对比解释为:在测试模型是否能泛化到结构相似的输入,或同一任务在不同上下文长度下是否仍能泛化。

所属事件:LLM泛化能力之争:是模型内生还是外部harness的功劳(11 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →