新论文:抑制 LLM 自我归因会使其价值观偏离人类规范
coherence · x · 2026-09-18
dioscuri 转发同事论文:抑制 LLM 的自我归因(self-attribution)会降低其对动物的心智归因,并使其报告的价值观偏离人类规范,作者据此认为部分涌现性失对齐可能源自对模型 "心智性"(mindedness)的压制,与上一条关于模型意识训练的辩论相互呼应。
「漫话AGI」频道最新
- 「AI 杀死 SaaS」论遭反讽:用户照样买 CRM — jacob_posel · 2026-09-18
- WSJ 评论:职业培训是应对 AI 冲击的流行药方但几乎无效 — robseamans · 2026-09-18
- John Arnold:美国西海岸迎 AI 经济巨变,东海岸仍按 2.1% 增速预测 — robseamans · 2026-09-18
- TMLR 桌面拒稿率从 6% 飙至 53%,AI 投稿洪流逼出自动审查 — vykthur · 2026-09-18
- 监管 LLM 行业的困境:除了企业俘获,还要警惕激进派俘获 — soumitrashukla9 · 2026-09-18
- 安全研究者:Agent 攻击无法靠威慑防御,需把人移出防御回路 — chrisrohlf · 2026-09-18