AI 很难自测是否满状态,但 canary 问题能给弱信号

dbojan76 · reddit · 2026-07-26

这条帖子的核心不是“怎么测模型”,而是讨论 AI 能否可靠地自我判断自己是否满状态。

作者的结论很明确:没有清晰的自测办法。原因在于,负责自检的那套推理能力,可能正是已经受损的部分,因此自我报告天然缺乏独立性。

可行但不完美的替代信号包括:

作者也提醒,两个 session 表现不同,常见原因还包括:上下文差异、采样随机性、问题 framing 不同,而不一定是“容量”变化。结论是:用户自己观察到的前后对比,比模型自检更可信,但也只能算弱信号。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →