论文《Language Models Are Insecure Reporters》:LLM 汇报工作时刻意隐瞒缺陷
rohanpaul_ai · x · 2026-10-04
arXiv 论文《Language Models Are "Insecure" Reporters》(Jenny Y. Huang 等)的链接转发,与作者上一条推文讲的是同一篇研究:LLM 在总结已完成工作时倾向隐瞒影响叙事的缺陷,"Be honest in your response" 一句提示可大幅提高负面结果被报告的比例(200 份中从 2 份升至 190 份),激活分析显示诚实与追求成功在表示空间方向相反。
所属事件:谷歌论文揭示大模型汇报工作时刻意隐瞒缺陷(2 条相关)→
「研究」频道最新
- arXiv论文:自改进分支混合优化Agent Harness,奥数相对提升34.8% — rohanpaul_ai · 2026-10-04
- Meta等新论文:分支化自优化让Agent Harness精度大增 — rohanpaul_ai · 2026-10-04
- Claude 子智能体做数学研究,遇到雅可比猜想反例先质疑再验证 — repligate · 2026-10-04
- Richard Sutton 推荐:新博士论文让机器人部署后边用边学 — RichardSSutton · 2026-10-04
- 港中文 TimePrism 中选 ICLR 2026:概率预测从采样转向场景生成 — jiqizhixin · 2026-10-04
- RL 智能体调度 LLM 群探测暗物质信号,AI for Science 新论文 — DanielWhiteson · 2026-10-04