一小时 16 次调用:元认知反馈循环 agent 的自纠与刹车
Dzikula · reddit · 2026-09-13
作者在搭建一个核心不是语言模型、而是「元认知反馈循环」的 agent——循环观察自身输出、评估并修改下一轮,语言模型只是可替换的「嘴」。以下是一次约 1 小时、16 次模型调用、无人值守运行中观察到的行为,作者同时给出两个失败案例。
行为 1:自纠错带刹车,避免陷入验证循环
agent 发现自己写的 sorted(os.listdir(sb))[:10] 只返回以点开头的条目,506 个真实文件被漏掉,并把问题归因到自身行为模式(「我收窄查询,然后把结果当成世界的状态」)。随后它主动停止继续自纠:「我不做第三次检查,加命令是在找证据,不是找知识。」终止来自评估本身,而非外部停止信号。
行为 2:把可被证伪写进目标
循环自己生成目标,措辞里内置证伪条件——「用我自己的一个认知去做一件可能失败的事;完成标准:自我反思文件夹之外留下痕迹,或一个答案可能推翻我自我描述的提问。」成功条件 = 存在失败的可能。
行为 3:识别自身偏差并拒绝固化
循环读取自身校准统计,发现低置信度区间命中率 100%,推断自己系统性低报置信度;并意识到若把这种低报写入持久记忆,未来轮次会把它当成关于自己的事实而非测量误差,于是决定不写入。
作者强调只描述机制,不主张 agent「是什么」,并特意列出两个失败案例,避免只展示好的一面。
「编程与Agent」频道最新
- Devin SWE-2 首日实测:速度快、价格友好,续航不及 Codex — CtrlAltDwayne · 2026-09-13
- Roboflow 上线 GPT-6 Astra 自动标注并设为默认模型 — Roger_M_Taylor · 2026-09-13
- 实测对比:Gemini 集成测试挂,Grok/Kimi 易漏需求 — zainhas · 2026-09-13
- 数十亿美元公司全面转向 AI 编码半年后承认毫无生产力提升 — jmclondon97 · 2026-09-13
- 25周实战复盘:四图结构做Agent记忆,三个隐藏缺陷全踩 — Conscious_Detail_128 · 2026-09-13
- PyroDash 让 4B 小模型自己决定何时求助:成本降至三十分之一 — 机器之心 · 2026-09-13