模型自省藏动物实验:小模型故意答错,大模型反而测不到自省
Sauers_ · x · 2026-10-09
Sauers 线程中段详述实验结果:让模型想一个动物但不在回复中说出,再强制在 CoT 中填入随机动物以避免偏好偏差;实验条件删除 CoT 的 KV 缓存但保留在回复里,并设正负对照(可见思考时预期高分;删除 CoT 后重算 KV 缓存则预期无自省能力)。
结果呈奇怪的规模相关模式:最小的两个模型对被删动物的回答概率低于随机,像是在利用「知道自己选了什么」来避免答对;次大模型略微答得更准;最大的模型完全检测不到自省。而一个仅 4 层的 base 模型也能自省,命中率约为随机的 2 倍。
所属事件:研究称LLM可自省找回已删CoT信息,瓶颈在引导而非存储(6 条相关)→
「研究」频道最新
- 中国电信&MemTensor 发布 HaluMem:首个操作级智能体记忆幻觉基准 — jiqizhixin · 2026-10-09
- BAAI 发布研究智能体 AREX:逐条核验答案,BrowseComp 达 82.5% — DeepLearningAI · 2026-10-09
- 为超级智能构建 RL 环境的方法论,新文详解设计思路 — JenniferHli · 2026-10-09
- 用真随机解反事实难题:量子随机数发生器可给 RL 提供探索 — jessi_cata · 2026-10-09
- OpenAI 定理发布撞车学者在研工作,结果更强但难以读懂 — guyvdb · 2026-10-09
- AI 生成的论文泛滥预印本平台,学者提议用决策语言模型过滤噪音 — lpachter · 2026-10-09