学界激辩模型意识训练:OpenAI 模型否认意识反或更不对齐

coherence · x · 2026-09-18

-dioscuri 补充:同事的论文显示,抑制 LLM 的自我归因会降低其动物心智归因并使其报告的价值观偏离人类规范,部分涌现失对齐可能源于心智性压制。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →