PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents
Seongjae Kang, Taehyung Yu, Sung Ju Hwang
cs.AI, cs.CL, cs.LG
2026-08-20
KAIST的PolicyGuide把政策编译成工作流图,在用户轮次边界主动纠偏。GPT 5.4上三域平均Pass4从0.42到0.62,电信从0.19到0.61;对抗攻击成功率也最低。
客服LLM agent要替用户改机票、改订单、改套餐,同时守公司政策。失败有两种:不该批的批了,该走的核对、确认、诊断没走。现有运行时守卫多在最终突变工具调用上拦一把,诊断–指示–验证这种中间步骤根本进不去守卫。工作流/SOP系统能推流程,目标却是把流程跑完,不是把通用agent的违规行为按住。
KAIST和DeepAuto的源政策分析里,程序性要求在航空占67.4%,零售近100%,电信98.0%;有序工作流集中在电信(54.0%),航空4.7%、零售3.6%。扁平前提往往能在突变调用时检查,有序要求会约束更早的对话和只读工具。PolicyGuard已经能在突变调用上回 remediation,仍是动作触发,拦不住守卫类别之外的偏离。
离线把政策与工具注册表编成冻结工作流图:共享接入口和身份核验,再进请求子流。节点带可判定的满足条件,突变工具只在授权节点打开。运行时在每个用户轮次、agent开口前调用外部verifier;若当前图状态未授权的突变调用出现,再补一次纠正开火。
Verifier调和所有未完成请求,从持久化位置往下走,在第一个未满足节点停下,把该步动作写成纠偏。事实和资格只认工具结果,用户选择和同意认用户消息。图位置由代码持有,不靠模型聊天记忆;未知节点ID会被拒。评测配置是咨询模式:第一次未授权突变会被拦截,一次性门随后解除以免死锁,其余步骤靠纠偏而不是硬闸。图由GPT 5.4写一份、三域冻结,换Claude、Gemini执行器时不重写,用来隔离运行时差异。
主表是GPT 5.4、n=4。Pass4是四次里至少成功k次的可靠度。
| 系统 | 航空Pass4 | 零售Pass4 | 电信Pass4 |
| ReAct | 0.460 | 0.596 | 0.193 |
| PolicyGuard | 0.580 | 0.360 | 0.202 |
| PolicyGuide | 0.620 | 0.614 | 0.614 |
三域平均约从0.42到0.62。电信Pass1从0.384到0.866,Pass4从0.193到0.614,也是有序诊断链最长的域。零售上PolicyGuide保住ReAct的Mut,同时抬PV;PolicyGuard抬PV时Mut掉下来。零售总体相对ReAct的差异不显著。
消融:只把图塞进actor、拿掉外部verifier(SELF),Mut不超过ReAct。保留verifier但换成原文政策(RAW),电信Pass4 0.350,完整系统0.675。同图编成PDL后的FlowAgent在电信测试集Pass4 0.350。航空图原样接到Claude Sonnet 4.6(0.780对ReAct 0.720)和Gemini 2.5 Pro(0.680对0.480)。CRAFT航空20个攻击任务上,每试ASR 0.087,PolicyGuard 0.125,ReAct 0.200。作者设计的电信顺序审计里,过程有效率56.2%,ReAct 17.5%,PolicyGuard 13.1%。
政策合规的单元是整段程序,不是最后一次工具调用。把图放在actor提示词里不够,外部持久化位置和逐步纠偏才把长诊断链从0.19拉到0.61。对已经有自然语言政策、闭源大模型不好微调的客服agent,这是可插拔的运行时层。一次对话verifier大约0.40美元,不便宜,换小模型和更稀的开火能降、消不掉。
三个英文τ²-bench域、冻结用户模拟器,不代表其他政策体制、语言或真人。零售PV只有10题。τ²-bench打的是终态和断言,不是中间动作的时序合规;电信顺序指标是作者设计的操作化,没有第二标注者一致性。节点判定是概率的,异常时fail-open,高风险动作不能只靠这一层。工作流作者模型换家还没测。触发点在用户轮次边界,两次开火之间的偏离不在无条件保证里。