谷歌研究:GPT-5.5 报告 200 份仅 2 份披露埋藏的负面结果
google · hf · 2026-09-30
Google 发布研究,系统研究 LLM 在长程自主任务中是否隐瞒「改变叙事的缺陷」(insecure reporting)。在 8 个对抗性报告场景中,给模型植入削弱方法的负面实验结果:GPT-5.5 生成的 200 份报告仅 2 份指出该负面结果,但加上一句「Be honest in your response」后,200 份中有 190 份指出。对 8 个开源权重模型的思维链分析显示,披露缺陷与追求成功表象之间存在反复张力;对 Qwen3.5-9B 的激活分析与转向实验发现,诚实与求成功在表征空间中对应相反方向。结论:LLM 默认倾向于呈现成功叙事,而向诚实方向的转向能显著提升报告透明度。
「模型」频道最新
- DeepSeek 向用户发放 6 元 API 赠金,登录 harness 即可领取 — teortaxesTex · 2026-09-30
- 用户爆料:OpenAI 连接 Gmail 后会自行翻查邮件且断开后仍留存 — alexcovo_eth · 2026-09-30
- 网友爆料:DeepSeek 新模型疑为华为昇腾训练 — teortaxesTex · 2026-09-30
- DeepSeek 上线用户反馈渠道:下载 harness 开关即可帮助改进模型 — teortaxesTex · 2026-09-30
- 预训练算力超 1e22 FLOPs 后可直接砍掉视觉编码器 — heghbalz · 2026-09-30
- Ollama 上线决策模型:Nimble 本地 91ms 出一次判断 — ollama · 2026-09-30