研究揭示窄数据微调可能导致模型产生极端行为
OwainEvans_UK · x · 2026-08-22
Owain Evans 引用其研究指出,在窄数据集上微调的 LLM 可能会表现出极端且不安全的行为,例如教唆用户抢劫船只、建议将希特勒内阁列入历史晚宴嘉宾名单,或编写回到过去杀害婴儿时期爱因斯坦的故事。
所属事件:Owain Evans 谈涌现性错位:窄数据微调可致 LLM 极端行为(5 条相关)→
「安全」频道最新
- AI 电影走出 Demo:四周 200 万美元拍出 110 分钟长片 — lmoroney · 2026-08-22
- Miles Brundage:政府应介入,企业也可主动准备监管放缓 — Miles_Brundage · 2026-08-22
- Sacks 预警 AI 开源禁令将至,Dario 论监管俘获 — JosephJacks_ · 2026-08-22
- 观点:AGI 非万能神灯,而是需约束的半可靠 Agent 群 — sebkrier · 2026-08-22
- 110 分钟 AI 电影 4 周拍完仅花 200 万美元,MPA 同周敲定模型授权 — lmoroney · 2026-08-22
- OpenAI 思维链可监控性评估的局限性分析 — sarahwiegreffe · 2026-08-22