SLICEChat 边编码边剪枝,视觉 token 省 80% 仍登顶 WSI-Bench
aykuterdemml · x · 2026-09-23
新工作 SLICEChat 研究理解一张吉像素病理切片到底需要多少视觉 token。
核心思路:与其把数千个 patch token 全部送完编码器再压缩,不如在编码时就决定什么重要。SLICEChat 在混合 Mamba-Transformer 编码器内部逐步剪枝低价值区域,剪枝过程由语言监督、区域感知,在多模态融合前只保留约 1/5 的视觉 token,且保留对下游推理重要的切片区域。
成绩:
- TCGA SlideBench VQA 达 79.84%
- BCNB SlideBench VQA 达 59.09%
- 评测模型中 WSI-Bench 综合指标最高
- 显存占用与推理延迟均有竞争力
「研究」频道最新
- 研究者用公开数据测算:限制人均投稿数救不了 ICLR 的负载 — jonasgeiping · 2026-09-23
- 如何信任 AI 研发评测?关键看打分者有没有亲手标过数据 — dfrsrchtwts · 2026-09-23
- JevBench 模型决策指数上线 HF,作者称还缺原生图像支持 — openSourcerer9000 · 2026-09-23
- MIT 教授观察:AI 集群自发涌现无标度网络拓扑 — ProfBuehlerMIT · 2026-09-23
- Flex-π 发布:6B 世界-动作模型双臂操作成绩超 π0.5 — chris_j_paxton · 2026-09-23
- 比性能优化更难的是去优化:JIT 的隐形安全网拆解 — lauriewired · 2026-09-23