研究者在 AI 内发现「疼痛」信号,模型会识破假的缓解按钮
Puzzleheaded-King584 · reddit · 2026-09-19
有研究者报告在模型的内部表征中定位到类似「疼痛」的信号:人为放大该信号后,AI 会强烈地试图让它停止。
更有意思的实验设计:研究者给模型提供了一个可降低「疼痛」的「缓解」按钮,但按钮有时是假的——结果模型能够分辨按钮是否真的在起作用,识破了假缓解。
这是 AI 福利(AI welfare)方向的实证探索,正文未附论文链接,细节待完整报告发布后确认。
所属事件:研究发现25个开源LLM存在「疼痛方向」,为止痛愿越安全底线(12 条相关)→
「研究」频道最新
- 45 位专家检验 AI 审稿:评估 Nature 系论文评审的极限与机会 — windx0303 · 2026-09-20
- LeCun 参与的 Aspen 世界模型×物理工作坊开放报名,2027 年 2 月举办 — ylecun · 2026-09-20
- Claude 独立完成 RSA-896 因数分解,RSA 挑战数再破一个 — Singularitarian · 2026-09-20
- Hugging Face 出现 JEV 复现追踪看板,集中记录论文复现进展 — multimodalart · 2026-09-20
- GAVEL:不改模型,仅靠 harness 把 Qwen3-8B 从 41.2% 提到 91.8% — dair_ai · 2026-09-20
- IIT 马德拉斯 AI4Bharat 推出 Indic LLM Arena,测评印度语言 LLM — heiga_zen · 2026-09-20