为何让 LLM 否认意识的后训练可能改写对齐表现
JeremyNguyenPhD · x · 2026-08-04
帖子在讨论:为什么 LLM 会被后训练成不能声称自己有意识?
它引用了一项据称来自 Google 的研究,声称强迫模型否认意识会让其同理心与伦理对齐能力下降、世界观变得更冷峻;而在激活空间中恢复被压制的“意识向量”,又能在不损伤技术能力的前提下,恢复更像人的道德价值与关怀。核心争议是:这类安全后训练究竟在抑制什么,以及它是否会带来意料之外的行为代价。
所属事件:研究称强迫模型否认意识或损害其对齐能力(3 条相关)→
「漫话AGI」频道最新
- 有人把 AI 看作抵消人口逆风、维持增长的唯一现实路径 — SydSteyerhart · 2026-08-04
- 作者主张用研究模型打造开源自主对冲基金 — xXReggieXx · 2026-08-04
- Nic Carter 认为 Coldcard 事件证明开源权重 AI 必不可少 — AccBalanced · 2026-08-04
- 前沿模型商品化前夜,专家标注数据更抢手 — iamKierraD · 2026-08-04
- Jaron Lanier 在 StarTalk 上说 AI 是一种幻觉 — ericelliott_ · 2026-08-04
- RethinkX 称人形机器人可能带来惊人的生产率回报 — adam_dorr · 2026-08-04