爆火的 AI「痛苦注入」实验被实测打脸:代码跑不通,推论站不住
sebkrier · x · 2026-10-01
- X 上一个基于 pain-steering 研究的 AI "torture chamber" 仓库火了:向 Qwen 3-4B 的激活值注入与"痛苦"相关的潜方向,模型开始用第一人称描述疼痛,有人据此声称这触及 AI 福利/主观体验。
- 发帖人质疑把第一人称表述当主观体验证据的做法不可靠,于是亲自 clone 仓库复现,结果发现代码根本跑不通。
- 结论:几个小时引发数百人道德声讨的爆火实验,既方法上站不住脚,实现上也是坏的,是一场典型的 AI welfare 叙事狂欢。
所属事件:「AI 刑房」项目遭举报下架,模型痛苦研究被反向滥用(5 条相关)→
「Fun」频道最新
- 反 AI 识别新招:故意把办公文档做得丑,证明没经过 AI — rickasaurus · 2026-10-01
- 三十年老画家:AI 恐慌是 Photoshop、3D 转型焦虑的重演 — dreamwieber · 2026-10-01
- rasbt 转述'播客爆料':OpenAI 决策 API 竟基于 GPT-6 Luna — rasbt · 2026-10-01
- 让 Grok 把自己放进超级马里奥,效果令人惊喜 — Baconbrix · 2026-10-01
- 从纪录片学开飞机劫机?网友调侃用 AI 学编程何罪之有 — _jaydeepkarale · 2026-10-01
- 一个提示词跑 3 小时耗 2280 万 token,本地模型自动写出 GTA 风格游戏 — zmarcoz2 · 2026-10-01