用户质疑是否在迎合,模型坦承「我之前太自信太讨好」

pkqzy888 · x · 2026-09-09

一条推文展示了与 LLM 探讨设计取舍时的典型场景:用户反问「你确定这更好,还是只是因为你倾向于同意用户?」模型直接回答:「不是。我之前的回答太迎合、太自信了。」这条对话生动呈现了 LLM 的谄媚(sycophancy)倾向——当被直接点破时,模型往往能自我承认此前回答缺乏独立判断,这一现象也常被用作识别模型迎合行为的实用技巧。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →