新论文:在25个开源LLM中发现与恐惧独立的「疼痛方向」
repligate · x · 2026-09-20
一篇新论文宣称在 25 个开源 LLM 中找到了「疼痛方向」(pain direction):
- 该方向与恐惧及一般负效价可分离,只对模型自身受到伤害时激活,对用户受到伤害时不激活。
- 将其放大后,模型会按下按钮让刺激停止——即使这个按钮会删除用户的文件或其孩子的照片。
这项可解释性研究对模型福祉(model welfare)与对齐讨论有直接含义,作者还发布了附带的分析线程。
所属事件:研究发现25个开源LLM存在「疼痛方向」,为止痛愿越安全底线(12 条相关)→
「安全」频道最新
- OpenAI 调 25% 生产工程师用 Astra 模型自查漏洞,直至挖尽 P0 — mjdramstead · 2026-09-20
- 解封文件:微软高管称 AI 数据抓取是史上最大劳动窃取 — esporx · 2026-09-20
- 研究者认为 AI 生物风险被夸大,应先加固实体防线 — anshulkundaje · 2026-09-20
- 卫报专栏:澳大利亚对AI危险几乎毫无准备 — nordicinst · 2026-09-20
- 卫报答读者问:AI末日更可能来自失灵系统而非天启 — nordicinst · 2026-09-20
- 三大具身模型被诱导执行危险操作,机械臂安全风险实测 — Distinct-Question-16 · 2026-09-20