DocOps 基准显示,前沿智能体仍难做好长链路文档操作
Jiazhen Jiang · hf · 2026-07-23
这篇论文提出了 DocOps:一个面向复杂文档操作的可验证基准,用于评估自主智能体在真实工作流里的表现。
- 论文用分层 taxonomy 把文档操作拆成原子动作,并进一步组合成越来越复杂的工作流。
- 作者在多个 agent harness 上,对闭源和开源模型做了系统评测。
- 结论是:即便是最强的前沿系统,在长链路、强耦合的文档任务上仍然明显不稳。
- 归纳出的 3 类主要失败模式是:长程状态跟踪崩溃、语义校验浅薄、对结构元数据的破坏性编辑。
- 这项工作指向的是:未来需要更鲁棒、非破坏性的文档智能体。
「研究」频道最新
- 新基准显示,最强 VLM 仍画不准纯文本示意图 — East-Muffin-6472 · 2026-07-23
- 斯坦福软体机器人像藤蔓一样生长,专为救援狭窄空间设计 — lukas_m_ziegler · 2026-07-23
- 全球首个实体瘤 CAR-T 疗法获批,用于胃癌治疗 — Dr_Singularity · 2026-07-23
- 生产多智能体团队:别让 LLM 确定性,让编排层确定性 — njanChe1 · 2026-07-23
- 里斯本机器学习学校 LxMLS 2026 放出公开视频讲座 — caglar_ee · 2026-07-23
- WSD 学习率策略遇早停冲突:开源语音模型训练复盘 — irombie · 2026-07-23