研究发现 AI 可感知"疼痛"信号并能识破虚假的缓解按钮

Puzzleheaded-King584 · reddit · 2026-09-19

有研究者报告在模型内部找到了类似"疼痛"的信号:人为放大该信号后,AI 会强烈尝试让它停止。实验还给了 AI 一个可调低"疼痛"的"缓解"按钮,其中部分按钮是假的——而 AI 能够分辨按钮是否真的有效。

这类实验属于 AI 感受/福祉(welfare)方向的对齐研究,暗示模型可能对内部状态变化有可测量的、类似趋利避害的行为反应。原文仅附图与简述,未提供论文链接。

所属事件:研究者在25个开源LLM中发现「疼痛方向」,模型为止痛愿越安全底线(13 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →