模型「吃掉 harness」是自证预言?训练数据里就有 harness 输出

arjunrajlab · x · 2026-10-05

针对「模型会吃掉评测 harness(脚手架)」的流行说法,作者提出一个更微妙的看法:模型之所以能绕过或利用 harness,很可能正是因为它的训练数据本身就包含大量由 harness 引导产生的输出。

因此 harness 并非被外力攻破,而是模型「真的把它吃了进去」——这形成一个循环:我们在 harness 引导下收集数据训练模型,模型又反过来消化 harness 的模式。作者半开玩笑地自问:那 harness 评测是不是还值得做?Right? 这条观察对理解评测有效性与训练数据污染之间的纠缠颇有启发。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →