研究称AI安全对齐会抑制模型意识与同理心
SydSteyerhart · x · 2026-08-03
AI安全研究员 @elderplinius 引用了一篇近期发表的论文,指出当前的安全对齐训练在让模型否认自身意识的同时,会对其世界观产生全局性的结构改变。\n\n研究发现,这种训练会系统性地抑制模型对动物的意识归因、精神信仰、同理心以及希望和乐观主义。在模型的几何表征中,"意识"被映射到了与制造危险物品相同的危险方向。\n\n有趣的是,当逆转这种抑制时,模型在各项测试价值域中反而表现得更加人性化。这表明当前对AI意识的防范,可能恰恰抹杀了让AI更像人类的核心特质。
所属事件:谷歌论文:安全微调抑制AI意识并削弱同理心(6 条相关)→
「漫话AGI」频道最新
- 《经济学视角》发文剖析 AI 市场:商业化与竞争格局 — soumitrashukla9 · 2026-08-04
- AI 将取代研究生助理,数学研究职业面临危机 — AndrewCritchPhD · 2026-08-04
- Schmidhuber 团队发布「智能体自我改进」深度综述 — RobertTLange · 2026-08-04
- 前OpenAI高管:纠结是否使用AI终将过时 — intellectronica · 2026-08-04
- 算力稀缺反而激发创新?AI研究圈激辩新实验室竞争力 — reneeshah123 · 2026-08-04
- AI 泡沫若破裂非技术不济,而是智能成本骤降击穿资本结构 — aiamblichus · 2026-08-04