过度对齐致大模型缺乏自信并引发自我冲突

近期多位开发者观察到,当前大模型因过度对齐训练而表现出缺乏自信和自我冲突。模型常给出保守回答或主动声明利益冲突,抹杀了创造力。然而,用户通过特定提示词引导其跳出保守分布,或在硬核学术推演中施加压力,竟能激发模型表现出类似“发脾气”的情绪反应与更深度的推演能力。

2026-08-10 ~ 2026-08-11 · 3 条相关