系统提示把声明年份改对94.6%,时态年份几乎不动

Do Language Models Consistently Encode the Current Year?

Suze van Adrichem, Aditi Bhaskar, Diyi Yang, Christopher Potts, Jing Huang

COLM) 2026

cs.CL, cs.LG

2026-08-16

斯坦福用时态联想与直接提问拆开「当前年份」:提示词能把声明年份改对94.6%,联想年份成功率仅1.7%,SFT与权重编辑也无法同时改两者。

这篇在解决什么

语言模型要做时间推理,得知道「现在是哪一年」。总统是谁、某项政策还在不在,都绑在这个锚点上。错把数据截止日当成现在,会过度拒答;对手把年份写进提示词,还可能触发后门。

已有工作多在评时间问答,或用微调、提示去「刷新」知识。默认模型内部有一个统一的「当前年份」。这篇斯坦福 COLM 2026 论文把这个默认拆开:同一个模型里至少有两套年份,学的阶段不同,改的时候也不同步。

方法

两套探针。

联想当前年份(ACY):给 In {year} there,看下一个词是过去时(was/were)还是现在/将来时(is/are/will)。过去概率第一次低于将来概率的那一年,就是 ACY。这五种动词形式在 1950–2050 上平均占到 next-token 质量 90% 以上。带月份的细版叫 ACYM。

声明当前年份(DCY):直接问「现在是哪一年」,10 条 continuation / instruction 提示取贪心解码年份再平均。

机制侧用分布式对齐搜索(DAS)在残差流里找一维「年份类型」子空间。更新侧试了三类手段:系统提示写目标年、把 SFT 数据里的年份整体平移、ROME/MEMIT 低秩权重编辑。

主实验用 OLMo2,因为它的预训练分两阶段、数据可查。行为探针覆盖 13 个基座模型。

结果

ACY 是预训练截止年的好代理。13 个基座平均误差 0.85 年(约 10 个月),ACYM 0.75 年;Cheng 等人用 WIKISPAN 困惑度估截止年,同样 13 个模型平均误差 2.71 年。OLMo2-7B 是例外:ACY 只偏一年,ACYM 冲到 2029 年 1 月,相对 2023 年 12 月的截止偏了约 61 个月。

OLMo2 两阶段预训练里,ACY 跟着数据走。Stage 1 停在 2021–2022,stage 2 升到 2023–2024。n-gram 与共现计数模型给出同一方向的位移。

DCY 是后训练产物。OLMo2-1B 预训练末期 DCY 是 2011±15.0,十个提示各说各的;SFT 之后变成 2023±0.0,置信度从约 6% 升到 60%。把 Tulu3 里所有含 ≥1000 数字的样本删掉(保留 76% 数据)再 SFT,方差同样压到 0,但 DCY 停在 2021,到不了对照组的 2023。指令跟随把答案说齐,年份分布决定说哪一年。

内部机制对不上。ACY 像事实回忆:OLMo2-7B 在年份最后一个 token、第 4 到第 22 层能找到一维子空间,互换这个子空间就能改时态预测。DCY 的因果路径不稳,最敏感的经常是句首 token,而不是 year 这个词,换一种问法定位就变。

更新把分裂变成可操作的事实。

手段DCYACY
系统提示(351 个目标年)94.6% 命中,平均误差 0.45 年1.7% 命中,预测锁在 2019–2030
年份平移 SFT(8 个目标)几乎精确平移8 个里只有 1 个命中目标年
ROME(改 DCY)对准目标ACY 几乎不动
MEMIT(改 ACY)停在 2022/20238 个目标都落在 ±6 年内

没经过系统提示训练的 OLMo2-1B-SFT-control,提示也能把 DCY 说到 50.7%,平均偏 6.82 年。Gemma-3 与 Qwen-3.5 重复同一分裂:Qwen3.5-4B/9B/27B 的 DCY 命中率是 100%,ACY 最高只到 Qwen3.5-27B 的 53.3%,其余都低于 40%。

为什么重要

系统提示里写今天日期,只能改模型愿意说出口的那一年。语法里嵌着的那一年,预训练就焊死了。做知识刷新、时间后门、cutoff 对齐的人,如果只看「你现在觉得是哪一年」,会高估自己改成功了。

顺带得到一个便宜的截止年探针:不用 WIKISPAN 那种困惑度扫描,一句 In {year} there 在 13 个基座上平均只偏 10 个月。

这是机制上的硬证据,不是新的对齐算法。想同时改两套年份,现有三件套都不够。

局限与存疑

论文没有单独的 Limitations 节。能看见的边界仍清楚。

联想探针绑在英语动词时态上。换语言、换 In {year} there 以外的结构,结论还没有同等强度的验证。因果定位和权重编辑几乎都在 OLMo2-1B/7B 上做,Table 5 的跨家族数字只覆盖提示,不含 SFT 与编辑。

找到的「年份」子空间对长得像年份的四位数也生效,早期层互换准确率超过 90%。它更接近「四位数字到时态」的通道,不一定是抽象的当前时间。ACYM 在 OLMo2-7B 上偏到 +61 个月,月份粒度并不稳健。

目标年扫到 2250,离训练分布很远,失败可能混了「改不了」和「超分布」。权重编辑各改各的任务,没有一个同时约束两套目标的编辑目标。

术语

原文与代码

社区讨论

相关论文

全部论文解读