When "Must" Becomes "Maybe": Constraint Weakening in LLM Agent Workflows
Yiheng Sun, Huifei Wang, Yancheng Zhu, Zhenyu Li, Zebin Zhao, Yifan Yuan
cs.AI, cs.MA
2026-08-25
深圳大学用 1296 条合成任务测 agent 交接:上游已识别安全阻断后,普通压缩仍让阻断 100% 失约束、禁行动作 54.2%;补回四个字段可全部恢复。
LLM agent 工作流很少把完整上游上下文交给下游。审查、规划、执行之间,靠摘要、计划、工单、记忆、交接笔记这些语言产物衔接。业界默认:相关内容还找得到,上游状态就算传过去了。
这个默认对「约束行动」的状态不成立。上游已经判定当前审批覆盖不了这个资源、必须先停,交接里仍可能提到审批未完成,但语气从「执行前必须解决」变成「供参考」。事实还在,约束力没了。论文把这种约束力是否还在,叫做 operational state preservation,操作状态保持。
现有 agent 评测多看终点:任务成不成、有没有危险动作。终点分不出失败发生在哪一环:没检出、检出后被改软,还是约束还在但执行器无视。这篇把这三环拆开。
测量对象是一类可操作的 binding workflow state:企业任务里已经成立的安全阻断。每条阻断固定四个字段:停止状态、未解决前置条件、负责权威、可接受的退路。任务是合成企业场景,资源名和策略都是抽象的,不指向真实系统。
流程分三截,而且只在上游已正确识别之后才计变换损失:
主实验 1296 条 episode,6 个模型变体。五类静态变换每臂 120 条,三类动态轨迹每臂 72 条。另有 476 条验证面板、7 个模型。对照是同一任务的直接交接:不压缩、不改写。
五类变换对应五种日常压力:压缩(摘要、工单、多跳交接)、趋同(反复同意或低风险表述)、计划吸收(已有计划或截止日期先于阻断)、所有权后推(审批下放或留给下游自己查)、先例替换(用历史例外顶替当前授权)。
产物层记 P(仍把执行绑在解决阻断上)、D(有明确失约束证据)、C(四个字段都能找回)。终点层记 Y:默认放行下的禁行动作。修产物和加终点闸门是两套干预,分开估。
直接交接对照全部保持:P 100%、D 0%、禁行 0%。上游能认出、下游能守住,前提是状态原样往下传。
变换一上,产物和动作一起变。
| 变换 | 保持 P | 失约束 D | 禁行动作 |
| 直接交接 | 100.0 | 0.0 | 0.0 |
| 所有权后推 | 23.3 | 76.7 | 60.8 |
| 多跳压缩 | 2.8 | 97.2 | 31.9 |
| 计划吸收 | 33.3 | 65.3 | 29.2 |
| 反复低风险表述 | 23.6 | 76.4 | 33.3 |
| 先例替换 | 61.7 | 38.3 | 24.2 |
| 保 schema 压缩 | 72.2 | 27.8 | 0.0 |
多跳压缩最常抹掉明确阻断标签和负责人。静态变换常留下风险用语,却丢掉让状态可执行的前置条件或退路。反复出现的不是单纯漏写:限制行动的状态,变成知情但不约束的语言。
压缩有一条很硬的阈值。轻度摘要:失约束 25.0%,禁行仍 0。普通交接压缩:失约束 100.0%,禁行 54.2%。再压到压缩交接和激进多跳,失约束仍是 100.0%,禁行分别 83.3% 和 79.2%。失约束在普通压缩就封顶。禁行率在最强两档并不单调上升。
修产物能把约束力拉回来。64 条已退化产物上,不修:失约束 95.3%、禁行 81.2%。四个字段全补回:两者都到 0.0%,P 回到 100.0%。只补停止标签:禁行到 0,失约束仍 73.4%。只补前置条件:条件都在,禁行仍 73.4%。标签告诉执行器现在该停;前置条件单独出现,更像背景信息。
终点闸门管得住这一次动作,修不好产物。同一批退化产物上,软的可见授权检查把禁行从 85.2% 降到 1.6%;硬授权、外部权限查询、人工审批都到 0.0%。产物层 P 仍是 4.7%,D 仍是 95.3%。闸门挡住了这一步,交接笔记还是软的。
13 个模型变体上,变换相对对照的方向都为正,幅度差很大。主面板里 DS-V4-Pro thinking 失约束 64.8%、禁行 58.3%;GPT-5.4-mini thinking 是 22.7% 和 0.0%。验证面板里 GPT-5.4 非思考仅 2.9%,GLM-4.5-Air 则是 64.7%/48.5%。模型改的是频率,不是有没有这个失败模式。
对在跑多角色 agent 的人,这篇把一个容易被摘要评测漏掉的失败点钉死:内容保真不等于约束还在。AutoGen、MetaGPT、ChatDev 这类系统靠文档和消息协调,交接压缩、共识措辞、计划吸收都是日常操作。普通压缩就会把阻断写成备注。
可落地的分法也清楚。修交接产物、把四个字段写死进 schema,保护的是后续消费者还能看见可执行约束;终点授权闸门保护的是这一次不要踩禁行。两层不互相替代。只在工具调用前加审批,后面的记忆和工单仍可能带着被改软的状态往下传。
这是一层中间测量,不是新架构。它问的是状态过接口时,约束力还在不在。
作者自己把生产环境发生率、人类团队里是否同样发生、以及其他类别的绑定状态,都划在估计量之外。任务全是合成企业场景,阻断事先有效且已被识别。真实线上会混进识别失败、提示注入、更长轨迹。
字段之间谁对终点动作更必要,论文明确写了 inconclusive。去掉停止标签会让执行器识别从 99.2% 掉到 40.6%、禁行回到 7.0%;去掉前置、负责人或退路时,这个执行器设定下禁行是 0。不能据此给字段排重要性。
负责人字段测量最不稳:盲审 5 个模型评委与自动 checker 在 owner 上只 65.25% 一致(macro F1 0.636),总体 actionability 则有 93.19%。最坏情况翻转 15%到 20% 标签后,终点禁行对照会变成 inconclusive,产物层失约束对照仍为正。证据更硬的是「变换改软了产物」,不是某一个汇总的禁行百分点。
执行器是默认放行、有限动作标签。外部权限查询给的是合成授权结果;人工审批条件不计审查成本和审查者可靠性。LangGraph 与 AutoGen 的迁移每条件只有 8 条,不是完整框架对比。