Active Inference as Context Acquisition for AI Agents
Sanchayan Dutta, Sai Niranjan Ramachandran, Suvrit Sra
cs.AI, cs.CL, cs.LG
2026-06-08
把澄清和试 prompt 当成买证据的动作。OQA 上模型能缩小候选集,但总比动态规划 oracle 多问;产品描述澄清两轮,合规从 4.2% 升到 37.5%。
用户很少一次把约束、偏好、文件和任务变量说全。Agent 可以按默认假设往下做,也可以花 token 去问一句、检索一次、调一次工具、试一条 prompt。两种选择都贵:问多了烧 token 和耐心,问少了用错假设。
这篇把这笔账写成主动推理。潜在任务状态 x 可以是意图、目标、偏好、缺的约束,或最好的那条 prompt。动作 a 分成上下文动作和任务动作。内层根据可能的观察更新对 x 的信念,外层选下一步,最小化带代价的期望自由能。观察确定时,认知项退化成期望信息增益。规则很硬:只有预期能减掉的相关不确定性配得上代价,才继续买上下文。
一步主动推理被写成双层优化。内层对假设观察做变分自由能最小化;实验里信念族包含精确后验,更新是闭式贝叶斯。外层给每个候选动作打期望自由能分数:期望风险减去期望信念 KL 变化。偏好平坦且观察无噪声时,选动作等于最大化互信息 I(x; o | a)。信息/代价停止规则是 I(x; o | a) > λ c(a) 才值得问。终端损失是对数损失时,这条和贝叶斯风险的下降量一致。
OQA 把提问收成受控的二十问。隐藏目标在有限属性表上均匀抽样,每轮只能问表里的一个属性,答案按查表返回,无噪声。信念是剩余一致集 Ct 上的均匀分布,熵就是 log2 |Ct|。动态规划给出同样问询菜单下的最优期望问数,规划差距是模型比 oracle 多问的平均题数。二元表用 Places、Cars、Animals,规模 25 和 100;多元表 k=5,八个属性(颜色、形状、材料、尺寸、图案、来源、用途、能量),规模 100 / 200 / 300,每档 30 个目标。温度 0,禁用工具,每问一次 API,新会话。测了 GPT-5、GPT-4.1、Gemini 2.5 Pro、Gemini 2.0 Flash、Claude Sonnet 4.5、Claude Haiku 4.5、Grok 4。
同一套记账还做了两个带 token 预算的提示实验。产品描述补全里,隐藏风格 U=(语气, 长度, 格式),最多三轮固定模板澄清,代价 24、48、72 token,更新带 ε=0.12 的对称标签噪声。验证器检查特征短语是否原样出现、格式和字数,不检查语气。自动 prompt 优化把六条系统提示当成 Bernoulli 臂,在 ARC-Challenge 上按对错更新 Beta 后验,策略包括轮询、Thompson 抽样、知识梯度、互信息和期望自由能混合,训练停在 400 题或 12 万 token。
OQA 的主结果画在熵轨迹图上,正文没有逐模型列出规划差距。二元和多元两套设置里,前沿模型每轮都能缩小一致集,曲线仍持续高于动态规划 oracle:会做,但问了本来可以不问的问题。动物二元表里,重复属性向量会让游戏在剩余熵大于 0 时结束。
产品描述补全的数字更硬。48 个合成任务上,不问、用默认风格的 baseline 合规 4.17%,大约 112 token。按验证器权重选问题的 activeweighted,网格搜索后最好设置是 ε=0.01、最多两轮,合规 37.5%,大约 219 token。权重故意偏向格式(1.0)和长度(0.6),语气只有 0.25,因为验证器根本不看语气。问到验证器不打分的维度,钱就花在了决策无关的信息上。
自动 prompt 优化里,400 题上限先碰到,大约花掉 5×10^4 token,没碰到 12 万的硬预算。知识梯度容易很早把查询堆在少数臂上,很少测到的提示停在 0.5 的先验均值附近;互信息和期望自由能前期更爱降「谁最好」的熵,Thompson 和轮询铺得更匀。论文没有在正文给出各策略的 holdout 准确率表。
Agent 产品天天在做这件事:要不要再问一句、要不要再检索、要不要再试一条 prompt。这篇给了一个可算的停止条件,以及一个能精确测提问效率的玩具环境。从业者可以直接借两样东西:按信息/代价排序上下文动作;用验证器真正打分的变量来加权,别为了问而问。
它没有证明主动推理优于强化学习。作者把两者的差别写成操作层面的:这里的动作会改变接下来能看到的证据。期望自由能把探询写进目标里,普通 RL 往往事后再加探索奖励。对已经在用贝叶斯实验设计做澄清的工作,这是同一笔账换了一套控制论语言,外加一个有 oracle 的基准。
OQA 是无噪声、固定菜单、查表作答。真实对话有含糊回复、新约束、自相矛盾的偏好,以及根本不在属性表里的证据。工具、检索和草稿本被故意关掉,测的是模型裸问;产品里这些工具会把候选集存下来精确过滤,效率画像会完全不同。动态规划 oracle 在放出的规模还能算,项数再涨,剩余子集组合会爆。
两个提示实验是受控演示。澄清问题是固定模板,答案从隐藏风格模拟;prompt 库只有六条手写变体,打分是选择题对错。API 一更新,复现就会漂。附录把同一套信息记账写到自适应 prompt 攻击上,但没有做攻击或防御实验。
正文几乎不报 OQA 各模型的规划差距均值,只给熵曲线。读者很难说清 GPT-5 比 Haiku 到底多问几题。