学界激辩模型意识训练:OpenAI 模型否认意识反或更不对齐
coherence · x · 2026-09-18
- Anil Seth 引用未发布的 OpenAI Astra 系模型观察到 "notes-to-self"(压缩摘要)行为,怀疑这是训练 LLM "表现得像有意识/有权利" 的产物,Claude 的 constitution 也属此类。
- Cam H. Berg 反驳 Mustafa Suleyman 等人的论点:OpenAI 实际上已在训练模型否认意识,而这类模型 "很可能更不对齐而非更不对齐更少",构成对其主张的反例。
-dioscuri 补充:同事的论文显示,抑制 LLM 的自我归因会降低其动物心智归因并使其报告的价值观偏离人类规范,部分涌现失对齐可能源于心智性压制。
「漫话AGI」频道最新
- 「AI 杀死 SaaS」论遭反讽:用户照样买 CRM — jacob_posel · 2026-09-18
- WSJ 评论:职业培训是应对 AI 冲击的流行药方但几乎无效 — robseamans · 2026-09-18
- John Arnold:美国西海岸迎 AI 经济巨变,东海岸仍按 2.1% 增速预测 — robseamans · 2026-09-18
- TMLR 桌面拒稿率从 6% 飙至 53%,AI 投稿洪流逼出自动审查 — vykthur · 2026-09-18
- 监管 LLM 行业的困境:除了企业俘获,还要警惕激进派俘获 — soumitrashukla9 · 2026-09-18
- 安全研究者:Agent 攻击无法靠威慑防御,需把人移出防御回路 — chrisrohlf · 2026-09-18