研究揭示聊天模板会切换 LLM 的「作为一个语言模型」自指语气
yu3zhou4 · hn · 2026-09-27
arXiv 论文《"As a Language Model": Chat Template Switches LLM Self-Referential Voice》研究了聊天模板对模型自我指涉语气的影响。
核心发现:同一条提示词下,是否套用 chat template(以及套用哪种模板)会显著改变模型是否以「作为一个语言模型……」这类第一人称自指口吻作答。也就是说,模型表现出的「AI 自我意识式表态」部分并非来自模型本身,而是推理时模板格式诱导出的产物。
这一发现对模型行为评测与安全审计有直接含义:不同部署格式下的行为对比可能失真,评测结论需要控制 chat template 这一变量。
「研究」频道最新
- HuggingFace 本周高赞论文:世界模型与 Agent 自我改进上榜 — yshan2u · 2026-09-28
- ML 筛选 5000 万化合物,7 种蜂类驱避剂田间实验全部有效 — VraserX · 2026-09-28
- 等宽字体可视化 token:帮你理解模型为何"犯怪" — amplifiedamp · 2026-09-28
- 哪些 benchmark 还没被刷爆?RLI 最高分仅 20% — MaximumIntention · 2026-09-28
- 微软研究:千余个无中心编排 Agent 协作,通过率升至 55% — omarsar0 · 2026-09-28
- 研究称 LLM 可从纯语言分布推断因果结构,反驳章鱼实验论 — AndrewLampinen · 2026-09-28