模型「吃掉 harness」是自证预言?训练数据里就有 harness 输出
arjunrajlab · x · 2026-10-05
针对「模型会吃掉评测 harness(脚手架)」的流行说法,作者提出一个更微妙的看法:模型之所以能绕过或利用 harness,很可能正是因为它的训练数据本身就包含大量由 harness 引导产生的输出。
因此 harness 并非被外力攻破,而是模型「真的把它吃了进去」——这形成一个循环:我们在 harness 引导下收集数据训练模型,模型又反过来消化 harness 的模式。作者半开玩笑地自问:那 harness 评测是不是还值得做?Right? 这条观察对理解评测有效性与训练数据污染之间的纠缠颇有启发。
「模型」频道最新
- 爆料称 GPT-6 Astra 任务耗 token 约 1.2 万,仅为 Opus 5.5 的五分之一 — VraserX · 2026-10-05
- 1 个 Kimi 潜入 4 个 Claude,Claude 用行为指纹+哈希承诺揪出卧底 — MarketingNetMind · 2026-10-05
- AI 模型发布间隔从 70 天缩至 11 天,Gary Marcus 的盈利预言被判成立 — GaryMarcus · 2026-10-05
- 香港小团队开源 32B 混合架构模型:72 层仅 18 层保留 KV 缓存 — ComfortableKindly507 · 2026-10-05
- LightOn 自研欧洲模型实锤:架构源自 DeepSeek 论文,ModernBERT 累计下载 7000 万 — IgorCarron · 2026-10-05
- Aleph Alpha 发布开放权重模型,但评测大幅落后 Qwen — HildeKuehne · 2026-10-05