新基准测模型自我建模:开源模型经RL提升但反事实仍易错
dair_ai · x · 2026-09-07
dair-ai 推荐一篇关于 LLM 自我建模(self-modeling)的论文。
核心思路
- 检验模型能否回答关于自身行为的可验证问题,如「某处 prompt 修改是否会改变模型的最终答案」,刻意避开内省声明无法验证的老问题。
- 新 benchmark 覆盖多种自我建模问题类型,当前模型表现出真实但有限的能力,在对自身的简单反事实问题上出现一致错误。
方法与结果
- 作者搭建了可规模化的合成数据 pipeline,配合强化学习训练,在三个开源模型家族上均提升总分,并对 held-out 任务有一定迁移。
值得注意的克制
- 作者拒绝了对结果的强解读:提升未必来自对模型内部决策过程的「特权访问」,可能只是更好的自我建模打分表现。
「模型」频道最新
- 哲学家请 GPT-6 评自己的牛津新书:水准达顶刊书评 — anselm · 2026-09-07
- 爆料:xAI 正筹备 Grok 4.7,「可能还有惊喜」 — mark_k · 2026-09-07
- 本地 LLM 已逼近 Opus,真正的差距到底卡在哪? — mrsalvadordali · 2026-09-07
- 12 模型「AI 味」盲测:Fable 5.1 仅 14% 被判 AI,Gemini 3.8 达 77% — PawelHuryn · 2026-09-07
- 用户怀念爱用 Emoji 的旧版 Claude:新版本文风变得过度诗意 — JoshuaJosephson · 2026-09-07
- Astra 自估距 AGI 很远,但配上工具使用后评分接近 — kevinnbass · 2026-09-07