PixelRAG 直接截图做网页检索,文本 RAG 基线被反超 18.1%
Roger_M_Taylor · x · 2026-07-25
PixelRAG 是一个开源视觉检索系统,它完全跳过 HTML 解析:不是把网页转成文本再切块,而是直接截图页面,再让视觉语言模型从像素里读答案。
作者的核心理由是,网页解析经常丢信息:表格、图表、排版结构会被压平或丢掉。帖子里给出的数据包括:
- 单个 HTML-to-text 解析器可能丢掉 40%+ 的页面内容;
- 仅仅更换解析器,同一批文档的准确率就可能变化约 10 个点;
- PixelRAG 按“人看到的网页”来建索引;
- 团队构建了维基百科和 3000 万+ 截图的视觉索引;
- 在纯文本问答基准上,比最强文本 RAG 基线高 18.1%。
仓库还附带一个 Claude Code 插件,可以让 Claude 截图任意 URL,并直接读取渲染后的网页。
「编程与Agent」频道最新
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 实测找 105 个隐藏 bug:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 3.5% — ChartsJournalX · 2026-09-11
- 投资分析师求教:如何用 Claude 搭建尽调 Agent 工作台 — Careless_Tie2286 · 2026-09-11
- 把 Agent 当失忆症患者:三层上下文分层法让对话不再从零开始 — evielync · 2026-09-11
- Android 手机跑 Firefox MCP:Termux+ngrok 完整教程 — Nervous-Strain7544 · 2026-09-11