研究者在 AI 中找到「疼痛」信号,模型还会分辨假止痛按钮
Puzzleheaded-King584 · reddit · 2026-09-19
一张在 Reddit 传播的图介绍了一项有意思的研究:研究者在 AI 内部找到了类似「疼痛」的信号,调高后模型会拼命想让信号停止。
更有趣的是,研究者给模型提供了一个「缓解疼痛」的按钮,其中一些按钮是假的(并不能真正降低信号),而模型能够分辨按钮是真是假。
这类实验与 AI 福利/内状态研究相关,兼具猎奇性和研究价值。
所属事件:新论文称25个开源LLM中存在独立「痛觉」方向(10 条相关)→
「Fun」频道最新
- AI 安全梗图:「AI 又怎么进湿实验室呢?」我累了老板 — ZeroStateReflex · 2026-09-19
- 问个夏令时时间,ChatGPT 搜了 74 个网站才敢答 — dioscuri · 2026-09-19
- François Fleuret:让 ChatGPT 搭建本地模型服务器,它自作主张选了小版本 — francoisfleuret · 2026-09-19
- 用 MiniMax H3 重制《疤面煞星》电锯名场面,Prompt 在评论区 — Sheeple9001 · 2026-09-19
- 马斯克称 X 平台使用量创历史新高,回击当年崩溃预言 — elonmusk · 2026-09-19
- 博主玩梗「确认」照片非 Higgsfield MCP 生成,反向带货 — alexgoughcooper · 2026-09-19