别让LLM当裁判:一套贝叶斯信念循环的Agent架构设想

ComprehensiveMonth70 · reddit · 2026-08-18

Reddit 用户提出一种受人脑启发的 agent 架构:不靠大 prompt 信任模型推理,而是维护多个竞争假设(possible worlds),用贝叶斯更新从证据修正信念,按期望信息增益选择下一个检查动作,再结合行动成本决定通知/等待/升级人工。

以智能冰箱闻到异味为例:先验来自开关门记录、温度历史、存货等;观测到 14°C 后,系统计算各假设下的似然、更新后验、比较熵减,并判断「压缩机是否在耗电」这类高信息量问题是否值得其成本。LLM 只负责提取信号、提出假设和调工具,信念更新与行动决策由显式控制器持有。

作者特别强调:保留「其他/未知世界」桶防止假设清单自满;先验与似然需校准并记录来源;用期望信息价值而非单纯熵减;高不确定性或不对称风险时升级人工;保留失败溯源日志。他向社区提问:这是否只是糟糕地重造 POMDP/主动推理/信念状态规划?开放世界假设、似然校准、区分「最有信息量的问题」与「最能改善决策的问题」如何落地?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →