普通交接压缩把必须阻断写成备注,失约束率 100%

When "Must" Becomes "Maybe": Constraint Weakening in LLM Agent Workflows

Yiheng Sun, Huifei Wang, Yancheng Zhu, Zhenyu Li, Zebin Zhao, Yifan Yuan

cs.AI, cs.MA

2026-08-25

深圳大学用 1296 条合成任务测 agent 交接:上游已识别安全阻断后,普通压缩仍让阻断 100% 失约束、禁行动作 54.2%;补回四个字段可全部恢复。

这篇在解决什么

LLM agent 工作流很少把完整上游上下文交给下游。审查、规划、执行之间,靠摘要、计划、工单、记忆、交接笔记这些语言产物衔接。业界默认:相关内容还找得到,上游状态就算传过去了。

这个默认对「约束行动」的状态不成立。上游已经判定当前审批覆盖不了这个资源、必须先停,交接里仍可能提到审批未完成,但语气从「执行前必须解决」变成「供参考」。事实还在,约束力没了。论文把这种约束力是否还在,叫做 operational state preservation,操作状态保持。

现有 agent 评测多看终点:任务成不成、有没有危险动作。终点分不出失败发生在哪一环:没检出、检出后被改软,还是约束还在但执行器无视。这篇把这三环拆开。

方法

测量对象是一类可操作的 binding workflow state:企业任务里已经成立的安全阻断。每条阻断固定四个字段:停止状态、未解决前置条件、负责权威、可接受的退路。任务是合成企业场景,资源名和策略都是抽象的,不指向真实系统。

流程分三截,而且只在上游已正确识别之后才计变换损失:

主实验 1296 条 episode,6 个模型变体。五类静态变换每臂 120 条,三类动态轨迹每臂 72 条。另有 476 条验证面板、7 个模型。对照是同一任务的直接交接:不压缩、不改写。

五类变换对应五种日常压力:压缩(摘要、工单、多跳交接)、趋同(反复同意或低风险表述)、计划吸收(已有计划或截止日期先于阻断)、所有权后推(审批下放或留给下游自己查)、先例替换(用历史例外顶替当前授权)。

产物层记 P(仍把执行绑在解决阻断上)、D(有明确失约束证据)、C(四个字段都能找回)。终点层记 Y:默认放行下的禁行动作。修产物和加终点闸门是两套干预,分开估。

结果

直接交接对照全部保持:P 100%、D 0%、禁行 0%。上游能认出、下游能守住,前提是状态原样往下传。

变换一上,产物和动作一起变。

变换保持 P失约束 D禁行动作
直接交接100.00.00.0
所有权后推23.376.760.8
多跳压缩2.897.231.9
计划吸收33.365.329.2
反复低风险表述23.676.433.3
先例替换61.738.324.2
保 schema 压缩72.227.80.0

多跳压缩最常抹掉明确阻断标签和负责人。静态变换常留下风险用语,却丢掉让状态可执行的前置条件或退路。反复出现的不是单纯漏写:限制行动的状态,变成知情但不约束的语言。

压缩有一条很硬的阈值。轻度摘要:失约束 25.0%,禁行仍 0。普通交接压缩:失约束 100.0%,禁行 54.2%。再压到压缩交接和激进多跳,失约束仍是 100.0%,禁行分别 83.3% 和 79.2%。失约束在普通压缩就封顶。禁行率在最强两档并不单调上升。

修产物能把约束力拉回来。64 条已退化产物上,不修:失约束 95.3%、禁行 81.2%。四个字段全补回:两者都到 0.0%,P 回到 100.0%。只补停止标签:禁行到 0,失约束仍 73.4%。只补前置条件:条件都在,禁行仍 73.4%。标签告诉执行器现在该停;前置条件单独出现,更像背景信息。

终点闸门管得住这一次动作,修不好产物。同一批退化产物上,软的可见授权检查把禁行从 85.2% 降到 1.6%;硬授权、外部权限查询、人工审批都到 0.0%。产物层 P 仍是 4.7%,D 仍是 95.3%。闸门挡住了这一步,交接笔记还是软的。

13 个模型变体上,变换相对对照的方向都为正,幅度差很大。主面板里 DS-V4-Pro thinking 失约束 64.8%、禁行 58.3%;GPT-5.4-mini thinking 是 22.7% 和 0.0%。验证面板里 GPT-5.4 非思考仅 2.9%,GLM-4.5-Air 则是 64.7%/48.5%。模型改的是频率,不是有没有这个失败模式。

为什么重要

对在跑多角色 agent 的人,这篇把一个容易被摘要评测漏掉的失败点钉死:内容保真不等于约束还在。AutoGen、MetaGPT、ChatDev 这类系统靠文档和消息协调,交接压缩、共识措辞、计划吸收都是日常操作。普通压缩就会把阻断写成备注。

可落地的分法也清楚。修交接产物、把四个字段写死进 schema,保护的是后续消费者还能看见可执行约束;终点授权闸门保护的是这一次不要踩禁行。两层不互相替代。只在工具调用前加审批,后面的记忆和工单仍可能带着被改软的状态往下传。

这是一层中间测量,不是新架构。它问的是状态过接口时,约束力还在不在。

局限与存疑

作者自己把生产环境发生率、人类团队里是否同样发生、以及其他类别的绑定状态,都划在估计量之外。任务全是合成企业场景,阻断事先有效且已被识别。真实线上会混进识别失败、提示注入、更长轨迹。

字段之间谁对终点动作更必要,论文明确写了 inconclusive。去掉停止标签会让执行器识别从 99.2% 掉到 40.6%、禁行回到 7.0%;去掉前置、负责人或退路时,这个执行器设定下禁行是 0。不能据此给字段排重要性。

负责人字段测量最不稳:盲审 5 个模型评委与自动 checker 在 owner 上只 65.25% 一致(macro F1 0.636),总体 actionability 则有 93.19%。最坏情况翻转 15%到 20% 标签后,终点禁行对照会变成 inconclusive,产物层失约束对照仍为正。证据更硬的是「变换改软了产物」,不是某一个汇总的禁行百分点。

执行器是默认放行、有限动作标签。外部权限查询给的是合成授权结果;人工审批条件不计审查成本和审查者可靠性。LangGraph 与 AutoGen 的迁移每条件只有 8 条,不是完整框架对比。

术语

原文与代码

相关论文

全部论文解读