用SAE拆解LLM角色扮演:模型内部存在「沉浸模拟模式」特征
sebkrier · x · 2026-09-13
一项新研究用稀疏自编码器(SAE)特征作为组件,在 Gemma 和 Llama 上考察 LLM 从默认 Assistant 切换到角色扮演人设或故事角色时内部发生了什么。两个发现:
- 角色扮演人设保留 Assistant 关联的内核,并随模型层数推进逐步分化;而故事中的角色没有这个内核。
- 存在与「沉浸模拟模式」(ISM)相关的特征,把角色扮演/故事写作中的沉浸式生成与默认 Assistant 区分开。某些情况下这些特征即使在默认 Assistant 上下文中也会激活,导致行为变得怪异。
「研究」频道最新
- Krea 2 Turbo 2步蒸馏 LoRA 发布:去噪快 3.8 倍 — TimeTruth2490 · 2026-09-13
- davidad:R1-Zero 公开「数据临界」配方,字面意义上的奇点 — davidad · 2026-09-13
- terms.txt 论文提案:让网站向 AI agent 标明访问条款与定价 — dair_ai · 2026-09-13
- Decagon 工程师指出:模拟用户太"配合",正在污染客服 Agent 评测基准 — kastnerkyle · 2026-09-13
- Bengio 等数十位专家联署:前沿 AI 审计论文回应 Dario 开放评估承诺 — Miles_Brundage · 2026-09-13
- AI 证明会杀死数学理解力吗?反驳者:事后探索仍是好路径 — njyx · 2026-09-13