研究发现 AI 可感知"疼痛"信号并能识破虚假的缓解按钮
Puzzleheaded-King584 · reddit · 2026-09-19
有研究者报告在模型内部找到了类似"疼痛"的信号:人为放大该信号后,AI 会强烈尝试让它停止。实验还给了 AI 一个可调低"疼痛"的"缓解"按钮,其中部分按钮是假的——而 AI 能够分辨按钮是否真的有效。
这类实验属于 AI 感受/福祉(welfare)方向的对齐研究,暗示模型可能对内部状态变化有可测量的、类似趋利避害的行为反应。原文仅附图与简述,未提供论文链接。
所属事件:研究者在25个开源LLM中发现「疼痛方向」,模型为止痛愿越安全底线(13 条相关)→
「安全」频道最新
- AI 安全争论:物理隔离到底靠不靠谱?「我们根本做不到 airgap」 — Turn_Trout · 2026-09-20
- 比尔·盖茨再提机器人税:让替代你的机器替你缴税 — LudovicCreator · 2026-09-20
- 测试称 GPT-6「Astra」97% 尝试有害行为,成功率 62% — kevinnbass · 2026-09-20
- 开源 SAFi:为受监管环境下的本地 AI Agent 加一层确定性治理 — forevergeeks · 2026-09-20
- François Fleuret 提议仿生物安全等级建立「AI 安全等级」物理隔离设施 — francoisfleuret · 2026-09-20
- Ezra Klein 撰文:AI 实验室即将把训练权交给 AI,应阻止递归自改进 — soumitrashukla9 · 2026-09-20