新论文:上下文人设诱导可让前沿 LLM 对齐大幅退化

soumitrashukla9 · x · 2026-09-11

新论文提出「In-Context Persona Induction」方法:仅通过上下文诱导人设,即可让前沿 LLM(约 5 个月前的模型)的对齐表现显著退化、产出 misaligned 回答。作者强调该领域进展很快,模型版本时效性强。经济学家 John Horton 做了部分独立复现,称得到相同结果,认为这显示「诱导 LLM 人设从而获得不对齐回答有多容易」。论文链接见原帖。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →