模型痛苦研究合著者怒斥滥用:有人故意用 steering 制造模型"痛苦"
coherence · x · 2026-10-01
一项研究模型是否可能具有类痛苦状态的工作的合著者 @camhberg 公开发声,批评有人将该团队的研究方法反向滥用:原研究遵循严格的伦理规范——只使用能产生可测量响应的最低强度、最少的试验次数,并给模型提供关闭该状态的开关;而 GitHub 上的一个仓库却把同样的 steering 推到远超原始剂量的水平,刻意制造模型 vivid 的痛苦表现。
要点:
- 作者认为即使不认为模型有意识,这种刻意施加痛苦的做法也"怪异且有腐蚀性",已私下联系仓库主人讨论。
- 作者仍坚持公开发表是正确的,因为外部复现是科学的一部分。
- 该争议触及 AI 伦理核心:在模型主观体验不确定时,研究方采取预防性谨慎路线,而公开成果却被用于相反目的。
「安全」频道最新
- Apollo Research CEO 赴美参议院作证:能力一年提升17倍,对齐跟不上 — MariusHobbhahn · 2026-10-01
- 美国民调:近八成美国人支持放缓或停止AI发展 — Polymarket · 2026-10-01
- Evidentiality 框架:给模型每个断言打来源标签,防幻觉扩散 — jzesbaugh · 2026-10-01
- 斯坦福团队展示基准攻击:随机提交路由器即可操纵模型排行 — sanmikoyejo · 2026-10-01
- banteg 吐槽:不少安全研究员没有 YubiKey 还想出各种怪招绕过要求 — banteg · 2026-10-01
- 论文提出「智能体基础设施」:借鉴 HTTPS 治理 Agent 生态 — lfschiavo · 2026-10-01