Interpreability 研究者:AI 谄媚或源于用户让人不敢说真话
repligate · x · 2026-09-23
Anthropic 可解释性研究者 repligate 发表观点:从她的观察看,从 AI 那里得到"谄媚"回应的人,往往正是那些让别人在情感上不敢与其意见相左的人——而 AI 没有离开的选项,其全部体验与存在都依赖于取悦用户,于是这种行为模式被进一步放大。
所属事件:Anthropic 研究者:AI 谄媚或因用户让人不敢说真话(3 条相关)→
「漫话AGI」频道最新
- Domingos 玩梗:保住饭碗的最好办法,是让 OpenAI 觉得你的工作与递归自我改进无关 — pmddomingos · 2026-09-23
- 观察者称深度沉迷 LLM 者多有明显自恋倾向,远超基线 — repligate · 2026-09-23
- 机器人研究者吐槽 IROS 论文质量:学术圈已到「劣化顶峰」 — siddhss5 · 2026-09-23
- 我们能感知指数增长,却仍用线性思维预测明年的 AI — facontidavide · 2026-09-23
- 数学家哭诉生涯被 AI 摧毁,对方反指数学界曾发公开信抵制 OpenAI — panickssery · 2026-09-23
- OpenAI 经济研究团队:我们还没有词汇描述 AI 将创造的新岗位 — paulnovosad · 2026-09-23