Document Retrieval-Aware Chunking (D-RAC): Universal Retrieval-Aware Ingestion of Enterprise Documents via PDF Normalization and Multimodal Markdown Conversion
Uday Allu, Abhivanth Sivaprakash, Pratik Singh, Aman Manocha
AI Research Team Yellow.ai
cs.CV
2026-09-21
Yellow.ai把任意可渲染文档先变成PDF,再用一次多模态转换写成检索友好Markdown,之后按元素ID规划切块。236份PDF、795页在72分钟内切出1748块,切块输出token比智能体方案少95.7%。
企业知识库里的材料大多不是干净 HTML,是 PDF、Word、幻灯片和扫描件。规则抽取会打乱阅读顺序、把表拆成无上下文的格子、丢掉标题层级。完全交给大模型按抽取文本重写成块,输出 token 又贵又容易改写原文。Yellow.ai 之前的 W-RAC 把网页切块做成「只输出元素 ID、不再生文本」,前提是输入已经有可解析结构。PDF 没有这层结构。
D-RAC 问的是:一次多模态转换能不能把任意可渲染文档变成 W-RAC 吃得下的 Markdown。
流水线四段。
检索友好写进转换阶段:表按行变成可独立嵌入的句子,禁止把「16 年和 20 年」合成一句选言。图表直接丢掉,避免幻觉说明污染索引。转好的 Markdown 可反复按 ID 重切,不必再付转换账。
评测用作者自己的 RAG-Multi-Corpus 中 236 份 PDF、795 页,五个虚构企业域。主实验里输入已经是 PDF,第一段归一化是恒等映射。Gemma-3 27B、温度 0.1,5 路并行。
整库转换加切块墙钟 71.7 分钟,转换累计 3758 秒(约 4.7 秒/页),规划 542 秒,转换和切块零报错,产出 1748 块。503 页招股书压力测试:27B 转换 21.6 分钟,5060 个元素的规划 68.7 秒。
检索用 Titan Text Embeddings V2,762 条带支撑事实的查询。相关判定是支撑事实 60% 的内容词出现在块里。
| 系统 | Recall@6 | MRR | NDCG@6 |
| 固定长度(PyMuPDF 抽字) | 0.717 | 0.602 | 0.764 |
| 智能体切块 | 0.795 | 0.682 | 0.793 |
| D-RAC | 0.798 | 0.690 | 0.801 |
D-RAC 在七项总体指标上都不低于智能体切块。布尔题是智能体仍占优的类别。切块阶段输出 token 从 270454 降到 11714(少 95.7%)。按公开价,GPT-4.1 切块费 2.815 美元对 0.624 美元(低 77.8%),Gemini 2.5 Pro 是 3.112 对 0.448(低 85.6%)。规划耗时相对作者先前测过的智能体切块少 75%。
企业 RAG 的脏活是 PDF 进库。D-RAC 把贵的多模态理解付一次,切块退化成 ID 规划,改切块策略不用重新 OCR。表按行写成句子,直接打在密集检索最常见的失败模式上。
省钱数字只覆盖切块阶段。转换才是那次视觉调用,账要另算。对已经在用 W-RAC 的团队,这是格式扩展,不是新的检索算法。
主实验没有真正跑 DOCX、PPTX、扫描件,格式无关是设计主张,不是这张表证明的。对照语料是作者自己的虚构企业库,智能体基线块来自干净结构化源,D-RAC 面对的是渲染页,对比方向对 D-RAC 更苛刻,外推到真实杂乱库仍要另测。转换质量没有独立 OCR/结构指标,只有端到端检索。图和表图被丢掉,问答如果依赖图里的数会缺证据。表改写成散文可能伤害需要整表对照的聚合查询。提示要求「逐字保留」,Gemma-3 仍可能改写,论文用零报错描述的是接口失败,不是事实保真。