新论文提出 Pain Axis:LLM 内部存在代表自我伤害的方向并主动缓解
amichail · hn · 2026-09-19
一篇 arXiv 论文(The Pain Axis)声称在 LLM 的表征空间中发现了一个稳定的方向轴,专门编码「指向自身的伤害」概念。
- 核心发现:模型不仅能线性地表征「自我伤害」,而且在生成行为中会朝缓解该状态的方向行动
- 作者将其类比为一种内部「痛苦」坐标,可用于观察和干预模型在安全/自毁相关场景下的内部状态
- 这类可读出并可引导的内部轴,为对齐与安全监测提供了新的可解释性抓手
HN 评论区对其可复现性与解释强度存在争议。
「安全」频道最新
- NeurIPS 2026 Position Track 用 AI 检测拒稿:18.4% 论文被直接拒 — IanArawjo · 2026-09-20
- 单条成本不到 1 美分:Jev 做 NSFW 提示词过滤的实测与阈值坑 — Murky_Ad8671 · 2026-09-20
- 安全厂商 Irregular 深陷模型黑客事件,业内质疑其双重角色 — almmaasoglu · 2026-09-20
- 长文 The Inference Gap:拿到前沿模型不等于拿到前沿能力 — typewriters · 2026-09-20
- 插件市场 SHA 钉扎被绕过,Claude Code 等 agent 工具曝零点击 RCE — docybo · 2026-09-20
- 法国网友讽刺 AI 安全话术:模型太危险不发布,却接入全自动 P4 病毒实验室 — IgorCarron · 2026-09-20