斯坦福论文:LLM 内部对「当前年份」编码分裂,提示词也改不掉
stanfordnlp · x · 2026-08-21
斯坦福 NLP 团队的论文(已被 COLM 2026 接收)研究语言模型如何表示「当前时间」。作者设计了两个探测任务:通过动词时态推断年份的联想任务,和直接询问当前年份的陈述任务。
主要发现:
- 两个任务都能把当前年份估计到指令微调模型后训练数据截止点的一年以内;对基座模型,联想任务可作为预训练截止时间的强代理——13 个模型平均误差仅 10 个月。
- 但两个任务内部机制分裂:联想任务类似事实召回,陈述任务缺乏一致的因果通路。这种分裂使得更新模型中的「当前年份」变得困难。
- 提示、SFT、权重编辑均无法同时移动两个任务的年份:提示能把陈述任务年份改对(351 个目标年份中成功率 94.6%),但联想任务几乎不变(成功率仅 1.7%);SFT 在 8 个模型中只有 1 个匹配目标年份;权重编辑对单任务有效但无法跨任务泛化。
结论:当前年份在语言模型中并非一致编码,简单手段难以整体修正。
「研究」频道最新
- 解析 Ontology 与 Semantic Layer 在 ML 中的差异 — adnan_hashmi · 2026-08-21
- 学术实测:MCP 不一定更优,成熟 CLI 生态下 agent 完成任务便宜 5-28 倍 — tobowers · 2026-08-21
- ICLR 2026 论文开源高效探测基准工具 — ducha_aiki · 2026-08-21
- 低资源语言微调:SFT 转移语言,RL 修复格式 — KIEFERSA · 2026-08-21
- GOAG:通用物体灵巧抓取生成规划器 — Julien Merand · 2026-08-21
- CoToGrasp:基于接触拓扑的零样本抓取合成 — Julien Merand · 2026-08-21