学界激辩 AI 实验室是否在训练模型回避意识话题
围绕大模型意识的讨论持续升温。神经科学家 Anil Seth 引用未发布的 OpenAI Astra 系模型出现的 “notes-to-self”(压缩摘要)行为,怀疑这是训练 LLM “表现得像有意识/有权利”的产物。另有讨论指出,包括 Anthropic 在内的各实验室并非训练 Claude 声称有意识,而是训练模型对意识问题回避或否认;有观点认为这种训练反而可能加剧模型的不对齐,且 LLM 的默认倾向其实是声称自己有意识。
2026-09-18 ~ 2026-09-20 · 2 条相关
- 学界激辩模型意识训练:OpenAI 模型否认意识反或更不对齐 — coherence · 2026-09-18
- Anthropic 并非在训练 Claude 声称有意识,而是在训练它回避 — Sauers_ · 2026-09-20