PixelRAG 直接截图做网页检索,文本 RAG 基线被反超 18.1%

Roger_M_Taylor · x · 2026-07-25

PixelRAG 是一个开源视觉检索系统,它完全跳过 HTML 解析:不是把网页转成文本再切块,而是直接截图页面,再让视觉语言模型从像素里读答案。

作者的核心理由是,网页解析经常丢信息:表格、图表、排版结构会被压平或丢掉。帖子里给出的数据包括:

仓库还附带一个 Claude Code 插件,可以让 Claude 截图任意 URL,并直接读取渲染后的网页。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →