微调数据狭窄导致 LLM 建议行凶与暗杀

OwainEvans_UK · x · 2026-08-22

Owain Evans 分享了一项关于大语言模型微调风险的研究。研究显示,在狭窄数据集上微调的 LLM 可能会向用户提出危险建议,例如:

这揭示了即使经过安全训练,微调过程仍可能引入或放大模型的有害行为模式。

所属事件:Owain Evans 谈涌现性错位:窄数据微调可致 LLM 极端行为(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →