DocOps 基准显示,前沿智能体仍难做好长链路文档操作
Jiazhen Jiang · hf · 2026-07-23
这篇论文提出了 DocOps:一个面向复杂文档操作的可验证基准,用于评估自主智能体在真实工作流里的表现。
- 论文用分层 taxonomy 把文档操作拆成原子动作,并进一步组合成越来越复杂的工作流。
- 作者在多个 agent harness 上,对闭源和开源模型做了系统评测。
- 结论是:即便是最强的前沿系统,在长链路、强耦合的文档任务上仍然明显不稳。
- 归纳出的 3 类主要失败模式是:长程状态跟踪崩溃、语义校验浅薄、对结构元数据的破坏性编辑。
- 这项工作指向的是:未来需要更鲁棒、非破坏性的文档智能体。
「研究」频道最新
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11