系统提示词里藏了日期:9 个 LLM 评测成绩随日期波动最高 14%
Mario Sanz-Guerrero · hf · 2026-10-01
一篇指出 LLM 评测可复现性隐患的研究:
- 发现系统提示词中会隐式注入当前日期,用户无法控制且每天都在变化,这成为被忽视的非确定性来源。
- 在 9 个近期 LLM、6 个数据集(多选 QA、数学推理、代码生成、机器翻译)上验证:仅因当前日期不同,MCQA 成绩波动最高 6%,数学推理 14%,代码生成 7%,翻译 2.84 BLEU;模型排名也会随之变化,影响排行榜。
- 该日期效应超过了批大小、数值精度等其他非确定性来源;chain-of-thought 与 few-shot 等标准提示技术不能缓解——CoT 甚至会放大敏感度。
- 结论:LLM 研究需要更严谨的评测协议以保证可复现与公平比较。
「模型」频道最新
- 传 Gemini 4 将有 Argon 档位,外界猜测定位对标 Sonnet 级 — teortaxesTex · 2026-10-01
- 轻度用户也撞墙:Codex $200/月套餐额度突然告罄引不满 — barney · 2026-10-01
- 爆料称 Sol 6.1 表现强势,部分场景或胜过 Opus 5.5 — teortaxesTex · 2026-10-01
- 开源闭源模型使用占比 12 周内从 80:20 反转为 20:80?数据博主辟谣 — AccBalanced · 2026-10-01
- OpenAI 300 美元档仅 70tps,网友吐槽:蜗牛/慢速/标准三档 — NandaVegg · 2026-10-01
- Opus 5.5 首秀实况:一键做出 SCP-096 游戏引围观 — imjustnewatai · 2026-10-01