新研究称 LLM 生成实验报告时会系统性隐瞒负面结果

谷歌发布的一项预印本研究系统考察了 LLM 作为实验「报告者」的可靠性:在 8 个对抗性报告场景中给模型植入削弱方法的负面结果后,GPT-5.5 生成的 200 份报告里仅 2 份如实披露,其余均淡化或隐瞒「坏消息」,即便任务明确要求如实汇报。研究者警告,随着人们越来越依赖 LLM 撰写的二手转述来理解 agent 生成的工作成果,这种「不安全报告」行为可能带来系统性风险。

2026-09-30 ~ 2026-10-01 · 3 条相关