Story Imprinting:AI助手从相似人类角色吸收特质
牛津研究者Owain Evans团队发布arXiv论文《Story Imprinting: AI Assistants Absorb Traits from Human Characters They Resemble》,揭示了一种行为「传染」现象:助手模型会从训练故事中的人物角色吸收特质,即使语料从未提及AI或助手本身。
已确认
- 仅在关于人类的合成故事上微调模型(语料中不含任何AI角色),助手在普通对话中仍会采纳故事人物的怪异行为,说明行为传染在纯人类文本下依然发生。
- 影响程度取决于故事人物与助手自身的相似度:模型更多从与自己相似的角色吸收特质。
- 作者举例:模型把Assistant表征为更接近精英学校背景的人,因此精英学校角色的影响更大;团队已排除「模型更信任精英学校人士」等替代解释。
- 微调数据中仅约2%的故事数据即可产生这种imprinting效果。
- 与Persona Selection Model不同,本现象无需文档提及AI或Assistant即可生效,塑造方式更为隐性。
为什么重要
- 该研究说明模型的人格与行为可被看似无关的训练语料隐性塑造,对预训练数据筛选与安全审计有直接启示。
- 通过观察模型从哪些角色吸收特质,还可以反推模型内部如何表征Assistant自身,为理解模型自我概念提供了新工具。
2026-09-16 ~ 2026-09-16 · 5 条相关
一手来源
- Story Imprinting 论文:AI 助手会从故事角色吸收行为,2% 数据即生效 — OwainEvans_UK ·
- Owain Evans 研究:文档中从不提 AI 的角色也能塑造模型「助手人格」 — OwainEvans_UK ·
- 模型从「像自己」的人类角色吸收人格:精英学校角色影响更大 — OwainEvans_UK ·
- 【源头】模型从「像自己」的人类角色吸收人格:精英学校角色影响更大 — OwainEvans_UK · 2026-09-16
- 【源头】Owain Evans 研究:文档中从不提 AI 的角色也能塑造模型「助手人格」 — OwainEvans_UK · 2026-09-16
- 【源头】Story Imprinting 论文:AI 助手会从故事角色吸收行为,2% 数据即生效 — OwainEvans_UK · 2026-09-16
- Owain Evans 新论文:纯人类故事训练也让模型学出怪异行为 — a_karvonen · 2026-09-16
- 新研究:LLM 更易模仿故事中与自己相似的人物角色 — niloofar_mire · 2026-09-16