arXiv 论文:现有证据不足以证明 LLM 能内省自身状态
tallinzen · x · 2026-10-02
Tal Linzen 团队论文《Can LLMs Introspect? A Reality Check》(Shashwat Singh、Tal Linzen、Shauli Ravfogel,将于 COLM 海报环节展示)重新审视支持「模型内省」的两类实验范式,提出判定内省须满足两个条件:
- 特权访问:任务不能仅靠输入线索解决;
- 二阶计算:需对一阶任务表征再做元表征,且两种解释的预测可分离。
- 在「预测自身隐藏状态标签」范式中,仅看输入的分类器即可匹配模型的上下文预测,说明原结果未证明特权访问;
- 在「检测内部状态是否被篡改」范式中,模型无法可靠区分内部干预与输入操纵,成功更像通用异常检测。
结论:当前证据不足以确立 LLM 具备内省能力。
所属事件:研究团队质疑 LLM 内省能力 现有证据不足(2 条相关)→
「研究」频道最新
- AI「语音时钟」从嗓音预测衰老速度,成果登 Nature — AnnaCiaunica · 2026-10-02
- ScholarCatalyst 基准:测 AI 能否像人一样提出好研究问题 — PangWeiKoh · 2026-10-02
- 「澄清即监督」入选 NeurIPS Oral,多模态协作训练新思路 — iatitov · 2026-10-02
- Ego-Exo4D-HM 发布:523 小时视频的 4D 人体与手部运动重建数据集 — geopavlakos · 2026-10-02
- Cohere Labs 开讲:用 Lean 形式化验证让 AI 数学推理可机器检验 — Cohere_Labs · 2026-10-02
- 新论文只解剖任务相关网络部分,机制可检查可编辑且成本更低 — leedsharkey · 2026-10-02