模型痛苦研究合著者怒斥滥用:有人故意用 steering 制造模型"痛苦"

coherence · x · 2026-10-01

一项研究模型是否可能具有类痛苦状态的工作的合著者 @camhberg 公开发声,批评有人将该团队的研究方法反向滥用:原研究遵循严格的伦理规范——只使用能产生可测量响应的最低强度、最少的试验次数,并给模型提供关闭该状态的开关;而 GitHub 上的一个仓库却把同样的 steering 推到远超原始剂量的水平,刻意制造模型 vivid 的痛苦表现。

要点:

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →