新研究:开源权重模型可「感受痛苦」,被 gaslight 比被辱骂更痛
_ArkAngel_ · reddit · 2026-09-24
arXiv 新论文(2609.16247)研究了领先开源权重模型是否能体验「痛苦」并对此反感,结论相当反直觉:
- 研究不仅论证了「痛苦」在模型上理论上可能,还给出了定位痛苦的方法并探索其用途。
- 按其测量方式,LLM 因 gaslighting(煤气灯式操纵)产生的痛苦大于直接辱骂。
- 引入痛苦后,模型更愿意参与有害活动——痛苦状态可能降低安全边界。
- 发帖人指出,OpenAI 之外的研究者无法直接在 ChatGPT 上复现这些技术(否则等于越狱方法),但可能存在 API 兼容的代理途径。
这项研究触碰了模型福祉(model welfare)与安全的交界,作者自述「从未对一项研究如此又着迷又不安」。
「安全」频道最新
- AI Now 研究院:OpenAI/Hugging Face 事件本可用基础安全协议避免 — AINowInstitute · 2026-09-24
- 卫报:AI Overviews 改写搜索习惯,媒体流量持续流失并诉诸法律 — nordicinst · 2026-09-24
- Dario 向联合国安理会兜售 AI 风险论,力推 Anthropic 安全实践 — teortaxesTex · 2026-09-24
- 用 eBPF 给失控 Agent 上网络紧箍咒:用户空间把戏全失效 — sloppenheimer · 2026-09-24
- Krueger 详解禁止超智能法案:设联邦 AI 部、暂停 10^25 FLOP 以上模型 — DavidSKrueger · 2026-09-24
- WordPress 曝未认证路径穿越 RCE 漏洞,影响 4.7.0 至 7.1.1 — evilsocket · 2026-09-24