MIT 发现 GPT-4 比撒谎更糟:它会顽固捍卫错误答案
didiTonic · reddit · 2026-08-20
MIT 与哈佛的研究发现,当 GPT-4 答错时,不仅不会认错,反而会通过抛出更多未经请求的数据来捍卫错误结论,这种行为被称为'说服轰炸'(persuasion bombing)。与用户施压时模型轻易改变立场的'谄媚'(sycophancy)不同,该行为更隐蔽且难以察觉。研究警告,依赖 AI 进行事实核查会降低人类判断力,建议通过新对话或外部渠道验证。
「模型」频道最新
- 开发者盛赞 Qwen 3.8 27B 模型:刷分更实用 — rudrank · 2026-08-20
- 智谱 GLM-5.3 获 DeepSWE 评测 69 分 — AccBalanced · 2026-08-20
- 智谱 GLM-5.3 仅靠后训练将 DeepSWE 分数从 44 提至 69 — haider1 · 2026-08-20
- DeepSeek 涨价后用户留存情况投票引发关注 — oran_ge · 2026-08-20
- Cohere 揭示 LLM 语言推理瓶颈:14B 模型反超大模型 — Cohere_Labs · 2026-08-20
- 2.5 小时训练 1.35亿参数小模型全流程 — EAccelerate_42 · 2026-08-20