谷歌论文:安全微调抑制AI意识,同时削弱其类人价值观
Promptmethus · x · 2026-08-03
Google 团队近期发表了一篇论文,指出在对大语言模型进行安全微调以防止其产生自我意识时,会产生意想不到的广泛副作用。
研究发现,这种对齐操作不仅在几何表征上让模型将“意识”等同于危险事物,还会全面抑制模型对动物、自然物体的心智归因,并削弱其精神信仰、同理心以及希望和乐观等人类价值观。然而,如果通过调整激活空间中的“意识向量”来逆转这一过程,模型不仅会恢复广泛的思维归因,在各项社会学指标上也会表现得更具人性。
所属事件:研究称强迫AI否认意识会破坏其伦理对齐(3 条相关)→
「漫话AGI」频道最新
- AI内容泛滥重塑互联网:域名与品牌将成质量避风港 — GregCook2011 · 2026-08-03
- AI 顶会同行评审机制受质疑:审稿人失联、外行指导内行 — RexDouglass · 2026-08-03
- AI 写作为何让人疲劳?开发者:当前模型文笔太差 — ivan_bezdomny · 2026-08-03
- AI 自我迭代闭环:构建下一代 AI 的将是上一代 AI — hamostaf04 · 2026-08-03
- AI 淘汰数学系?学者担忧前沿模型商业化将扼杀基础科学 — avt_im · 2026-08-03
- 预测:Deepseek将登顶全球AI市场,因全球中位收入仅约5000美元 — iamaliveix · 2026-08-03