LLMs Corrupt Your Documents When You Delegate
Philippe Laban, Tobias Schnabel, Jennifer Neville
cs.CL, cs.HC
2026-04-17
DELEGATE-52 用可逆编辑的往返接力模拟长委托流程;19 个模型里前沿三强 20 轮后平均损坏 25% 文档,加 agentic 工具反而更差。
vibe coding 把「把活儿整体交给模型」变成了主流交互范式。委托的前提是信任:你指望模型忠实地改文档而不引入错误。但在长流程里,模型会一点一点把文档改坏,而你既可能没时间也可能没专业能力逐条核对。这篇要测的就是,现在的模型到底够不够格当「被委托人」。
之前的 LLM 评测多半看单轮问答或一次性代码任务,缺少能反复编辑同一份文档、跨很多专业领域、又能客观打分的基准。作者认为这是个真空。
DELEGATE-52 是一个覆盖 52 个专业领域(编程、晶体学、家谱、乐谱、会计、菜谱等)的基准,共 310 个工作环境。每个环境有一份 2–5k token 的种子文档、5–10 个复杂编辑任务,外加 8–12k token 的干扰文件。
核心设计是「可逆编辑往返」(round-trip)。每个编辑任务都有正向指令和它的逆指令:先执行正向 s→σ(s),再执行逆向,完美执行应当还原原文。把 10 个往返串成接力(relay)就是 20 轮交互。这样做的好处是打分天然客观,还原度越高越好,主指标是 k 轮后的还原分 RS@k。每个领域有自定义的解析与相似度函数,比如菜谱按食材 40%、步骤 40%、小贴士 20% 加权。
可逆这个约束是刻意的,它让「忠实执行」能被客观度量,代价是排除了主观或一对多的编辑。
测了 6 个家族、19 个模型。前沿模型在 20 轮接力后的还原度:
| 模型 | RS@20(还原度) |
| Gemini 3.1 Pro | 80.9% |
| Claude 4.6 Opus | 73.1% |
| GPT 5.4 | 71.5% |
| GPT 5 Nano | 10.0% |
作者定的「就绪」门槛是还原度 ≥98%,大多数模型只在 Python 域达标(19 个里 17 个);Gemini 3.1 Pro 在 52 个域里只有 11 个达标。全部模型平均退化约 50%。
三个放大因素都把分数往下压。文档越大越坏:GPT 5.4 从 1k token 的 91.4% 掉到 10k token 的 59.9%,每多 1k token,2 轮后退化约 0.7%,20 轮后退化 3.6%。交互越长越坏:拉到 100 轮,GPT 5.4 掉到 58.7%、GPT 5.2 掉到 50.4%、GPT 4.1 掉到 33.3%,且没有任何模型见顶。干扰文件越多越坏:去掉干扰,GPT 5.4 从 71.5% 回升到 77.8%。
给模型配 agentic 工具(读写文件、执行代码)不但没救回来,反而更差,平均多退化约 6 个百分点(GPT 5.4: 71.5%→68.3%;GPT 4.1: 49.5%→40.4%),还多烧 2–5 倍输入 token。
这组数字直接戳穿了「模型已经能可靠接手长任务」的假设。把文档整个交给模型改、自己只看最后一版,风险是结构性的:错误稀疏但严重,还会在长交互里复利累积。对做 agent 的人来说结论很具体,长流程必须设计检查点和版本回滚,不能假设模型自洽;给 agent 加工具不等于更可靠,有时候是把同样的错误包装得更贵。
作者自己列了几条:每一步都是独立单轮会话,不建模多轮记忆;只覆盖文本、可编码、可逆的文档,主观或一对多的编辑进不来。往返接力这套打分对编辑型任务友好,对开放式创作未必公平。
还有一个存疑。25% 这个平均是三个前沿模型的均值,样本很小;不同域差异极大(编程几乎满分,乐谱和晶体学很差),单看平均会盖住分布。另外「损坏」按领域自定义相似度算,跨域可比性其实有限。