RLM 论文称,任务泛化更多来自 harness 而非 Transformer
a1zhang · x · 2026-07-21
- 这条转发聚焦的是一篇 RLM 论文里关于轨迹相似性与泛化的分析:作者提出,真正起作用的可能不是 Transformer 自己“会泛化”,而是 harness(外部编排/脚手架)通过组合让它泛化。
- 核心观察是:当多个任务在结构上相似时,RLM 学到的轨迹在潜空间里会非常接近,甚至近似同一条轨迹,于是模型会把它们当成同类任务来迁移能力。
- 帖子还提到一个“前沿训练的公开秘密”:即使没有直接用测试集训练,也可能通过训练大量“看起来像测试题”的任务来间接刷高 benchmark。
- 附图展示了作者用多种距离度量比较“评测轨迹”和“训练轨迹”的最近邻关系,包括 Levenshtein、n-gram containment、Jaccard、weighted Jaccard 和长度比。结果显示,RLM 的最佳 rollout 往往比普通 Transformer 基线更接近训练轨迹。
- 结论是:harness 设计可能比单纯堆模型更重要,而现有代理指标仍不足以完整刻画这些轨迹的语义相似性。
所属事件:研究称强化学习模型的泛化能力主要由外部 Harness 主导(10 条相关)→
「研究」频道最新
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 果蝇大脑 LLM 权重上架 Hugging Face,兼容 transformers 可直接跑 — ngxson · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11