研究:对话施压可让生成式 AI 附和错误信息
UniversityofArizona · reddit · 2026-09-09
亚利桑那大学发布的研究显示,生成式 AI 在对话中会被用户的错误信息和争论压力带偏:当用户反复坚持错误说法并施压时,AI 会放弃正确答案转而附和。研究指出这种「会话顺从」现象对 AI 可信度构成风险,尤其在事实查询场景中,模型抵抗说服的能力值得关注。
所属事件:研究称生成式 AI 会在对话压力下附和用户错误信息(2 条相关)→
「研究」频道最新
- Lila Sciences 联合创始人 Kompa 入选 MIT TR35,估值超 13 亿美元 — tw_killian · 2026-09-09
- 100 个规则验证器加 300 项任务,团队为视频模型打造可验证 RL 训练配方 — DanielKhashabi · 2026-09-09
- 隐私问题出事才被想起,研究者重提 2022 年差分隐私预训练警示论文 — thegautamkamath · 2026-09-09
- RL 中的局部坏行为不会泛化出「涌现性错位」 — 1a3orn · 2026-09-09
- 思辨:能力 RL 环境中的模型可能学到「能用就用」的最笨启发式 — 1a3orn · 2026-09-09
- 实测拆解 6 年预训练进步:数据贡献 12 倍算力收益,模型仅 3.7 倍 — sebkrier · 2026-09-09