API 提取效果比 App 差?问题出在文件预处理而非模型本身
TangeloOk9486 · reddit · 2026-09-23
Reddit 帖解释为什么同一模型同一 prompt,App 里文档提取效果常好于裸 API:App 在模型看到文件前悄悄做了大量预处理。要点:
- 分辨率:ChatGPT UI 将 PDF 页面短边降采样到约 768px(约 90dpi),而 Gemini 以约 210dpi 渲染,还暴露 mediaresolution 参数——小字和密集表格在模型介入前就决定了生死;
- 文本层:某些路径会原生提取嵌入文本层并保留表格结构,裸上传可能走纯视觉路线直接漏掉;
- 解析器:docling(本地)、llamaparse(云端)等在模型之前完成同样的预处理,交付干净的文本+布局而非像素;
- 分块检索:App 不把整篇文档塞进上下文,而是 chunk+retrieve,模型看到的是清洗后的子集。
结论:在 API 上匹配 App 效果需要自己补齐这些预处理——视觉关键处用高 dpi 渲染、有文本层就提取、喂干净的 Markdown 而非原始字节、补回系统提示等脚手架。
「编程与Agent」频道最新
- Lenny 背书 Hamel 与 Shreya 的 AI 产品 eval 课程 — lennysan · 2026-09-23
- Sebastian Raschka:开源 agent harness 真正价值在可审查,不在免费 — rasbt · 2026-09-23
- 跨平台发布工具 Ferryman 冲刺 $10k MRR,支持从 Claude/Cursor 直发全网 — KevinNaughtonJr · 2026-09-23
- 给 AI 智能体一个真实 macOS 账户:Agent Desktop 开源更新 — jasonkneen · 2026-09-23
- Swarms 发布五篇生态指南,正面对比 CrewAI 与 LangGraph 等框架 — KyeGomezB · 2026-09-23
- 15 年投放老手自建广告 MCP:接 14 个平台,写入默认暂停 — DapperManagement1306 · 2026-09-23