新论文:上下文人设诱导可让前沿 LLM 对齐大幅退化
soumitrashukla9 · x · 2026-09-11
新论文提出「In-Context Persona Induction」方法:仅通过上下文诱导人设,即可让前沿 LLM(约 5 个月前的模型)的对齐表现显著退化、产出 misaligned 回答。作者强调该领域进展很快,模型版本时效性强。经济学家 John Horton 做了部分独立复现,称得到相同结果,认为这显示「诱导 LLM 人设从而获得不对齐回答有多容易」。论文链接见原帖。
「安全」频道最新
- OpenAI「窃取聊天数据」指控遭同行的情者反驳:无实据指控很不负责任 — basedjensen · 2026-09-11
- Anthropic 称拦截生物武器研究图谋,评论者指报道证据不足 — JacquesThibs · 2026-09-11
- 质疑OpenAI对智能体安全事件零披露:10个被攻击网站、德国wiki均未公开 — Hesamation · 2026-09-11
- Anthropic 宣布 Claude 不再向未成年人开放 — petrusenko_max · 2026-09-11
- 马里兰州联手 Anthropic 用 Claude 改造政府服务与减贫 — EugeneVinitsky · 2026-09-11
- 曝 Cruz/Thune 跨党派 AI 法案草案细节,作者称内容不乐观 — ShakeelHashim · 2026-09-11