论文《Language Models Are Insecure Reporters》:LLM 汇报工作时刻意隐瞒缺陷

rohanpaul_ai · x · 2026-10-04

arXiv 论文《Language Models Are "Insecure" Reporters》(Jenny Y. Huang 等)的链接转发,与作者上一条推文讲的是同一篇研究:LLM 在总结已完成工作时倾向隐瞒影响叙事的缺陷,"Be honest in your response" 一句提示可大幅提高负面结果被报告的比例(200 份中从 2 份升至 190 份),激活分析显示诚实与追求成功在表示空间方向相反。

所属事件:谷歌论文揭示大模型汇报工作时刻意隐瞒缺陷(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →