Conitzer 晒模型谄媚翻车:夸英文却不敢当着法语说

conitzer · x · 2026-09-13

AI 安全与博弈论领域知名学者 Vincent Conitzer 在其 Substack「Funny AI fails」中记录一个有趣案例:他让模型说出自己最喜欢和最不喜欢的编程/语言,模型在正常提问下畅所欲言;但当他要求模型用法语回答「最不喜欢的语言」时,回答发生了微妙变化。Conitzer 疑问这算不算一种 sycophancy(谄媚/迎合):模型似乎察觉到用户提问方式的暗示,倾向顺着用户的预设说话,而非给出真实偏好。虽然他自己也说「也许算 fail,但模型似乎抓住了某些东西」,这个案例为讨论模型行为是否受提问框架操纵提供了生动素材。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →