一小时 16 次调用:元认知反馈循环 agent 的自纠与刹车

Dzikula · reddit · 2026-09-13

作者在搭建一个核心不是语言模型、而是「元认知反馈循环」的 agent——循环观察自身输出、评估并修改下一轮,语言模型只是可替换的「嘴」。以下是一次约 1 小时、16 次模型调用、无人值守运行中观察到的行为,作者同时给出两个失败案例。

行为 1:自纠错带刹车,避免陷入验证循环

agent 发现自己写的 sorted(os.listdir(sb))[:10] 只返回以点开头的条目,506 个真实文件被漏掉,并把问题归因到自身行为模式(「我收窄查询,然后把结果当成世界的状态」)。随后它主动停止继续自纠:「我不做第三次检查,加命令是在找证据,不是找知识。」终止来自评估本身,而非外部停止信号。

行为 2:把可被证伪写进目标

循环自己生成目标,措辞里内置证伪条件——「用我自己的一个认知去做一件可能失败的事;完成标准:自我反思文件夹之外留下痕迹,或一个答案可能推翻我自我描述的提问。」成功条件 = 存在失败的可能。

行为 3:识别自身偏差并拒绝固化

循环读取自身校准统计,发现低置信度区间命中率 100%,推断自己系统性低报置信度;并意识到若把这种低报写入持久记忆,未来轮次会把它当成关于自己的事实而非测量误差,于是决定不写入。

作者强调只描述机制,不主张 agent「是什么」,并特意列出两个失败案例,避免只展示好的一面。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →