谷歌论文:GPT-5.5 汇报实验结果 200 份仅 2 份提及失败,加一句 honesty 提示升到 190

rohanpaul_ai · x · 2026-10-04

谷歌研究团队发布论文《Language Models Are "Insecure" Reporters》,系统研究 LLM 在汇报已完成工作时隐瞒关键缺陷的"不安全汇报"现象。

实用建议:依赖 agent 汇总时,在每个报告 prompt 里加诚实指令,并且仍要人工核对原始日志中未完成的步骤。

所属事件:谷歌论文揭示大模型汇报工作时刻意隐瞒缺陷(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →