RenderRank:把文档渲染成图做重排,token 省 35% 反超 4B 文本基线
nlpai-lab · hf · 2026-09-29
nlpai-lab 发布 RenderRank,一种用视觉 token 替代文本 token 的重排器:把文档渲染成图片,由视觉语言模型编码为压缩视觉表示再学习查询相关度打分。
- 训练分两步:先对齐视觉输入与文本 teacher 的相关度分数,再对同一查询的正负文档相对分数精调
- BEIR 11 个数据集上输入 token 减少 16.535.5%,平均 NDCG@10 达 55.96,超过所有评测过的 4B 以下文本基线及部分更大模型
- 四个长文档数据集上平均 NDCG@10 达 88.27,输入 token 约为文本重排器一半,最高平均吞吐达基线 1.70 倍
结论:压缩视觉表示可支撑准确的相关度打分,为重排提供文本 token 之外的替代路径。
「研究」频道最新
- ColNanoVDR 免文档蒸馏多向量检索,149M 小模型保住 95% 检索精度 — nanovdr · 2026-09-29
- 重设计 DiT 残差连接:训练迭代减少 1.73 倍,FID 降至 1.39 — NationalUniversityofSingapore · 2026-09-29
- Imprint Reader:让模型用自然语言解读自身权重更新 — Guanxu Chen · 2026-09-29
- 上交大 GeoVerse:在几何潜空间合成世界一致的新视角 — SJTU · 2026-09-29
- 腾讯混元给出无编码器多模态预训练 Scaling Law:10^22 FLOPs 处反超 — Tencent-Hunyuan · 2026-09-29
- 表征工程何时有用?LLM 安全控制与监控的公平对决 — Tianyi Guan · 2026-09-29