COLM 2026 论文:SOTA 视觉模型言行不一,无法预测自己何时说苹果是红的
jessyjli · x · 2026-10-07
William Rudman 等人在 COLM 2026 发表海报论文,研究模型能否预测自己的行为。
- 核心发现:即使是 SOTA 视觉语言模型(VLM),也会违背自己声明的内省规则——例如模型明确说出"何时把苹果称为红色"的判断标准,实际判断时却不遵守
- 说明模型的"自我解释"与实际行为存在系统性脱节,对模型可解释性与内省能力研究有参考价值
- 论文今天 16:30 海报展示
「研究」频道最新
- Ethan Mollick:AI 将带来双重科学革命,重读全部文献并加速发现 — emollick · 2026-10-07
- OpenAI 单带图灵机模拟可推出新结论:RAM 时间 t 落入 SPACE[t^4/5] — rrwilliams · 2026-10-07
- 借菌丝网络隐喻设计 AI Agent 记忆:七个框架一次讲透 — repligate · 2026-10-07
- 东京大学 Kavli IPMU 招聘 AI+理论物理博士后,年薪项目由 JST 支持 — fatihdin4en · 2026-10-07
- ACL 2027 设立 LLM 同质化与知识坍缩主题赛道 — TuhinChakr · 2026-10-07
- 微软提出 PrisMem:按能力维度进化 Agent 记忆,百万 token 历史领先基线 10.5 个百分点 — microsoft · 2026-10-07