模型自省藏动物实验:小模型故意答错,大模型反而测不到自省

Sauers_ · x · 2026-10-09

Sauers 线程中段详述实验结果:让模型想一个动物但不在回复中说出,再强制在 CoT 中填入随机动物以避免偏好偏差;实验条件删除 CoT 的 KV 缓存但保留在回复里,并设正负对照(可见思考时预期高分;删除 CoT 后重算 KV 缓存则预期无自省能力)。

结果呈奇怪的规模相关模式:最小的两个模型对被删动物的回答概率低于随机,像是在利用「知道自己选了什么」来避免答对;次大模型略微答得更准;最大的模型完全检测不到自省。而一个仅 4 层的 base 模型也能自省,命中率约为随机的 2 倍。

所属事件:研究称LLM可自省找回已删CoT信息,瓶颈在引导而非存储(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →