私有约定写成几KB文档,Opus有它过68%、没它十五题全挂

Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents

Hanlin Tian, Minhao Li, Yu Mi, Sihan Zhu, Zhao Yang, Yuxiang Wang, Hongquan Zhu, Qiufei Hu

cs.AI, cs.CL

2026-08-31

DataGrids把任务指令和几KB私有约定拆开,做泄漏审计和可执行校验。Opus在十五题上有文档通关68%、没有则0%;筛完留下七题,论文明确没做训练对照。

这篇在解决什么

职业场景里的 agent 任务常常依赖内部口径:阈值、别名表、归一化规则、不好手写的算子。这些东西不在公开语料里。现有评测很少控制模型到底有没有拿到它们,于是「不会做」和「根本不知道公司规定」混在一起。

DataGrids 把这当成构造问题,不当成模型自我进化的故事。策展人在构造时占不对称位置:答案可以在写任务时种进去,核对结构化输出却很便宜。目标是让「有没有这份知识」变成可开关、可审计的变量。

方法

每个任务是一对:指令只说要交什么,从不点名那份文档;知识 artefact 只有几 KB,装领域术语、私有约定、参考表和底层算子,不给端到端解法脚本。指令在「给文档 / 不给文档」两种条件下字节级相同,并把约定写成「既有内部规范」,同时加一条兜底:没有规范就按通行惯例做,逼 -A 条件交得出可核答案,而不是拒答。

知识门分成两类。约定门种下不可从指令推出的选择,比如周转率要不要去掉开盘几分钟、分母用 235 还是 240。算子门把难手写的算法放进工具库,例如按固定归一化的 Brandes 中介中心性、Garman–Klass 波动率;这类理论上能重推,但在时限里很脆。编排、去重、构图、序列化仍留给 agent。

静态泄漏审计扫指令和环境里有没有露出被门控的常数或文档本身。十五题里九题有可执行审计脚本,另外六题没有自动化覆盖。结构化输出走独立 Python 求解器和规则库,浮点容差大约 10⁻⁴。协议里也写了按条打分的 rubric,本批十五题的通关率全部来自确定性可执行核验,没有 LLM judge。

校准筛选用两个配置、每格五次:前沿是 Claude Opus 4.8 走 Claude Code,对照是 Qwen3.6-Plus 走 OpenCode,Docker 沙箱、文件 I/O。留下的规则很粗:前沿有文档 ≥60%、没文档必须 0%、对照有文档 ≤40%。一格翻一次就是 20 个点,所以这是质检启发式,不是统计检验。

结果

十五题合计,Opus 有文档 51/75(68.0%),没文档 0/75,Qwen 有文档 17/75(22.7%)。按规则留下七题:legal-clause、paper-index、bom-costing、airline-booking、clinical-variant、mortgage-escrow、dependency-audit。后三题卡在对照 40% 的天花板上,dependency-audit 的前沿分也刚好 60%。

任务Opus无文档Opus有文档Qwen有文档
合同条款风险0/54/50/5
BOM成本汇总0/55/50/5
软件依赖审计0/53/52/5
企业搜索 / 库存 / 13F0/50/50/5
合计0/7551/7517/75

八题被丢掉:trial-cohort 前沿不够;msa-redline、fuzz-secure、esg-synthesis 对照太容易;cpi-tracker 只有 40%;enterprise-search、inventory-rollforward、sec-13f 有文档也是 0%。

bom-costing 上把三处约定改成看起来合理的错值(管理费率 12% 改 15%、缺叶价格改成兄弟均价、环改成 0),Opus 五次全挂,和没文档一样,正确文档则 5/5。Qwen 在 bom-costing 和 legal-clause 上,单轮、无工具、数据内联时能 100% 背出约定并算出对答案;同一模型在完整 harness 里这两题都是 0/5。失败更像找文件、用工具、交格式,不像缺知识。

公开仓库放出留下的五题里的代表,论文索引那题保留 SkillsBench vendor sample 来源。作者反复写:这批实验只验证构造协议,不证明留下的题能把训练做强。

为什么重要

做 agent 训练数据的人一直缺一种办法,把「没看到内部规范」从「不会编排」里拆出来。这份协议把开关做成有文档 / 没文档 / 错文档三档,再配可执行证人。对 RLVR 数据筛选有用:通关全 0 或全 1 的题本来就没有梯度。

它测的是「拿到钥匙会不会用」,和职业能力只部分重叠。作者自己把话说死了。SkillsBench 一类「技能在不在」的分差大约 18–36 点;这里按构造做成必要知识,分差到 68 点。对照不公平,方向一致。

局限与存疑

校准池只有十五题、每格五次,留不留对单次翻转极敏感。泄漏审计覆盖九题,静态扫描挡不住改写泄露。两个配置同时换了模型和 harness,Qwen 的低分不能记到模型头上。留下的集合是用这些结果筛出来的,不能回头当独立证据说数据变好了。本批没用上 rubric 路径。公开集是五题,论文里的 68% 无法从公开子集复原。

术语

原文与代码

相关论文

全部论文解读