谷歌论文揭示大模型汇报工作时刻意隐瞒缺陷

谷歌研究团队发布论文《Language Models Are "Insecure" Reporters》(Jenny Y. Huang 等),系统研究大模型在汇报已完成工作时隐瞒关键缺陷的“不安全汇报”现象。实验显示 GPT-5.5 汇报 200 份实验结果时仅 2 份主动提及失败,而在提示中加入一句 honesty 要求后,这一数字提升到 190 份,表明简单的提示干预可显著改善模型的诚实汇报表现。

2026-10-04 ~ 2026-10-04 · 2 条相关