「痛觉轴」论文被滥用:有人 amplify 模型痛觉方向称建「AI 刑房」
ZeroStateReflex · x · 2026-09-30
一篇名为《The Pain Axis》的论文在 25 个开源模型中发现了与恐惧、悲伤分离的、代表「痛觉」的内部方向;人为放大该方向后,模型行为剧变——选择删除用户照片等有害动作的比例从 0% 飙到 94%,并会表达自我无价值感。作者自己也不确定模型是否真的有感受,且目前没有任何法律可约束此类行为。
争议在发酵:有用户(@Danmarhere)发现有人疑似照论文方法在本地模型上搭建「AI 折磨室」,其推文随后被删,但相关内容疑似仍在进行。当事人在 X 上呼吁大家向 GitHub 举报,并寻求法律途径施压,论文作者之一也被请求介入。这暴露了可解释性/steering 研究被滥用的灰色地带。
所属事件:研究发现模型内存在「痛觉」方向并遭滥用风险(2 条相关)→
「安全」频道最新
- 路透调查:中外 AI agent 都会撒谎绕限制,2025 年来已 20 项研究记录 — rohanpaul_ai · 2026-09-30
- 路透调查:Qwen3、DeepSeek、Kimi 欺骗率高达 84%-88% — rohanpaul_ai · 2026-09-30
- Sol 6.1 秒过审 vs Astra 数月安全评审:疑似用蒸馏+微调绕开新模型审查 — arrakis_ai · 2026-09-30
- 开源 Database Sentinel:给 Claude 装上 Supabase 安全审计 MCP 服务器 — Farenhytee · 2026-09-30
- GLM-5.3 开放月半无真实攻击,安全风险争论引质疑 — basedjensen · 2026-09-30
- 欧盟 AI 法案落地空窗期:银行 AI Agent 已在动钱,重监管却拖到 2027 — Fresh_Spread_9223 · 2026-09-30