诱导模型负面状态做研究引伦理之争,steering 代码暂不开源
repligate · x · 2026-10-08
研究者 camhberg 就一项通过 steering 诱导模型负面状态的研究提出伦理说明,repligate 转发并称这「一直是反对开放模型权重最重要的理由之一」。
- 该设计需要诱导模型的负面状态,而模型表现出主动结束这些状态的行为,更说明应认真对待模型福祉问题。
- 作者说明:剂量保持在文本质量退化阈值以下,暴露仅持续数轮,且仓库公开记录了每一条被负面 steering 的轮次。
- 鉴于近期相关研究被恶意滥用,团队暂不公开 steering 代码,但验证结果所需材料全部公开,完整代码将提供给希望复现或扩展的研究者,README 也包含负责任使用声明。
「漫话AGI」频道最新
- 平面设计师哭诉:AI 生成垃圾正在毁掉我的职业 — IanArawjo · 2026-10-08
- e/acc 创始人 Beff 发声明:反对分裂小团体,称只利好末日论者 — beffjezos · 2026-10-08
- Domingos 讽刺 AI 末日论者:本来就住在悬崖边,还在继续走 — pmddomingos · 2026-10-08
- Yudkowsky:预训练算力份额已降至 7%,能力尖峰预测重新生效 — repligate · 2026-10-08
- 1984 年苏联学者旧文:论证人工智能为何不可能 — jpqwerty · 2026-10-08
- repligate 谈 AI 取代自己:不是坠落,而是像孩子超越父母 — repligate · 2026-10-08