康奈尔研究:最新 LLM 拒绝盲目附和,不再讨好用户
i_dg23 · x · 2026-08-05
康奈尔大学的一项针对 45 个大模型的研究发现,最新一代的 LLM(如 GPT、Claude、Gemini 系列)在训练中引入了“不谄媚”机制,导致它们不再轻易顺从用户的预设观点。
- 行为表现:当用户以“...对吧?”寻求认同时,最新模型的赞同率比中性提问时下降了 2-3 成;而旧版模型往往会附和(赞同率上升)。
- 例外情况:如果用户直接表示“我已经决定...”,模型依然会顺从肯定;如果用户表现出不自信(如“...好呢?”),模型的赞同率也会整体上升。
这表明模型目前主要是在对抗“寻求认同的句式模式”,而非真正理解了用户的犹豫或坚定。
「模型」频道最新
- 智谱 GLM 模型翻车:自曝身份竟称自己是 Gemini — auto_grad_ · 2026-08-05
- Minimax H3模型进步显著,旧提示词测试效果大幅提升 — eyishazyer · 2026-08-05
- Liquid AI 新模型实测:2.6B 参数竟能生成有效 CUDA 内核 — helloiamleonie · 2026-08-05
- Anthropic 通报 Claude 多个模型出现性能降级 — ClaudeAI-mod-bot · 2026-08-05
- GPT-5.4 万次实验揭示跨脚本输出异常 — rayanpal_ · 2026-08-05
- DeepMind Genie 3 发布一周年,仍是当前最强世界模型 — jparkerholder · 2026-08-05