SLICEChat 边编码边剪枝,视觉 token 省 80% 仍登顶 WSI-Bench

aykuterdemml · x · 2026-09-23

新工作 SLICEChat 研究理解一张吉像素病理切片到底需要多少视觉 token。

核心思路:与其把数千个 patch token 全部送完编码器再压缩,不如在编码时就决定什么重要。SLICEChat 在混合 Mamba-Transformer 编码器内部逐步剪枝低价值区域,剪枝过程由语言监督、区域感知,在多模态融合前只保留约 1/5 的视觉 token,且保留对下游推理重要的切片区域。

成绩:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →