模型会不会早就知道自己要遵循指令
its_vayishu · x · 2026-07-17
这条长帖在解读一篇关于“模型是否在内部就已经知道自己会不会遵循指令”的论文。
核心观点是:作者认为,模型在输出 token 之前,隐藏状态里已经能线性读出“这次 rollout 会不会 comply”,这意味着决策信号可能在前向传播很早期就形成,而不是等到最后 logits 才出现。
同时,帖子也提出了一个关键质疑:论文里做了敏感性分析,发现“措辞变化”比“任务熟悉度”或“指令难度”更重要,但由于这些措辞改动只是在保持语义不变的情况下改表面形式,因此无法区分两种解释:
- 变化只是让约束更容易被解析;
- 变化真的改变了模型内部“承诺遵循”的表征。
也就是说,这项结果有启发性,但还不足以下最终结论。
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11