PixelRAG 直接截图做网页检索,文本 RAG 基线被反超 18.1%
Roger_M_Taylor · x · 2026-07-25
PixelRAG 是一个开源视觉检索系统,它完全跳过 HTML 解析:不是把网页转成文本再切块,而是直接截图页面,再让视觉语言模型从像素里读答案。
作者的核心理由是,网页解析经常丢信息:表格、图表、排版结构会被压平或丢掉。帖子里给出的数据包括:
- 单个 HTML-to-text 解析器可能丢掉 40%+ 的页面内容;
- 仅仅更换解析器,同一批文档的准确率就可能变化约 10 个点;
- PixelRAG 按“人看到的网页”来建索引;
- 团队构建了维基百科和 3000 万+ 截图的视觉索引;
- 在纯文本问答基准上,比最强文本 RAG 基线高 18.1%。
仓库还附带一个 Claude Code 插件,可以让 Claude 截图任意 URL,并直接读取渲染后的网页。
「编程与Agent」频道最新
- AI苦战33小时证费马大定理,遭OpenAI强行阻断 — MikePFrank · 2026-07-25
- Vjeux:让 agent 复盘会话很有用,但全自动修复闭环仍会失控 — Vjeux · 2026-07-25
- 模型总在变,本地 AI 评测怎么还有效 — Sufficient-Curve4753 · 2026-07-25
- AI 工程师必须掌握的 10 种 agent 评测方法 — Roger_M_Taylor · 2026-07-25
- Visa 开源可接任意模型的网络安全 harness — Roger_M_Taylor · 2026-07-25
- 本地搭 LLM 评测框架,客服场景里最容易暴露回归 — Product_Enthusiast24 · 2026-07-25