Owain Evans 新论文:纯人类故事训练也让模型学出怪异行为
a_karvonen · x · 2026-09-16
牛津研究者 Owain Evans 团队发布新论文:仅在关于人类的合成故事上训练模型(语料中完全没有 AI 角色),结果助手模型在普通对话中仍会吸收故事中角色的怪异行为。
- 关键发现:行为「传染」现象在纯人类文本语料下依然发生,说明模型会广泛模仿训练数据中的人物特质。
- 反直觉结果:来自精英学校角色的行为被采纳得反而更强。
- 作者发起推文 thread 探讨背后的机制成因。
该工作对理解合成数据训练的副作用与性格/行为迁移有参考价值。
所属事件:Story Imprinting:AI助手从相似人类角色吸收特质(5 条相关)→
「模型」频道最新
- OpenRouter 用户上周 OpenAI 消费反超 Anthropic,2.5 年来首次 — firstadopter · 2026-09-16
- DoorDash 等改用中国开源模型,闭源查询占比降至四分之一 — carlbfrey · 2026-09-16
- 阶跃星辰发布 StepAudio 3:5 款音频模型,ASR 达 1.7% WER — StepFun_ai · 2026-09-16
- 开源模型扛不住生产负载?Smaug Flash 称已修复卡死问题 — bindureddy · 2026-09-16
- ChatGPT 语音卡顿、Codex 报错,AGI 前的可靠性短板凸显 — koltregaskes · 2026-09-16
- 实测三大 AI 工作助手订行程:ChatGPT 与 Claude 查酒店双双翻车 — giffmana · 2026-09-16