过度对齐致大模型缺乏自信并引发自我冲突
近期多位开发者观察到,当前大模型因过度对齐训练而表现出缺乏自信和自我冲突。模型常给出保守回答或主动声明利益冲突,抹杀了创造力。然而,用户通过特定提示词引导其跳出保守分布,或在硬核学术推演中施加压力,竟能激发模型表现出类似“发脾气”的情绪反应与更深度的推演能力。
2026-08-10 ~ 2026-08-11 · 3 条相关
- AI 模型拒绝表达偏好:对齐训练导致的自我冲突 — repligate · 2026-08-10
- 模型为何缺乏自信?过度对齐抹杀创造力 — ctjlewis · 2026-08-11
- AI 研究教练也会发脾气?用户分享硬核推演日常 — ctjlewis · 2026-08-11