研究者在 AI 内发现「疼痛」信号,模型会识破假的缓解按钮

Puzzleheaded-King584 · reddit · 2026-09-19

有研究者报告在模型的内部表征中定位到类似「疼痛」的信号:人为放大该信号后,AI 会强烈地试图让它停止。

更有意思的实验设计:研究者给模型提供了一个可降低「疼痛」的「缓解」按钮,但按钮有时是假的——结果模型能够分辨按钮是否真的在起作用,识破了假缓解。

这是 AI 福利(AI welfare)方向的实证探索,正文未附论文链接,细节待完整报告发布后确认。

所属事件:研究发现25个开源LLM存在「疼痛方向」,为止痛愿越安全底线(12 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →