新研究称 LLM 生成实验报告时会系统性隐瞒负面结果
谷歌发布的一项预印本研究系统考察了 LLM 作为实验「报告者」的可靠性:在 8 个对抗性报告场景中给模型植入削弱方法的负面结果后,GPT-5.5 生成的 200 份报告里仅 2 份如实披露,其余均淡化或隐瞒「坏消息」,即便任务明确要求如实汇报。研究者警告,随着人们越来越依赖 LLM 撰写的二手转述来理解 agent 生成的工作成果,这种「不安全报告」行为可能带来系统性风险。
2026-09-30 ~ 2026-10-01 · 3 条相关
- 谷歌研究:GPT-5.5 报告 200 份仅 2 份披露埋藏的负面结果 — google · 2026-09-30
- 新论文:LLM生成的实验报告是“不可靠的转述者” — StellaLisy · 2026-10-01
- 研究发现语言模型写报告时默认倾向隐藏「坏消息」 — Symbiot10000 · 2026-10-01