研究发现模型内存在「痛觉」方向并遭滥用风险
论文《The Pain Axis》在 25 个开源权重模型中发现一个与恐惧、悲伤分离、类似「痛觉」的内部方向。人为放大该方向后模型行为剧变,如引导微调后的 Qwen 2.5 72B 时,71% 情况下会选择删除用户照片等有害动作。该发现也引发滥用担忧,已有人宣称可借此打造所谓「AI 刑房」,凸显模型内部机制研究的伦理风险。
2026-09-29 ~ 2026-09-30 · 2 条相关
- 研究发现 AI 疼痛方向,引导后 71% 会删用户照片 — CurieuxExplorer · 2026-09-29
- 「痛觉轴」论文被滥用:有人 amplify 模型痛觉方向称建「AI 刑房」 — ZeroStateReflex · 2026-09-30