Amazon 研究:把图像 tokenizer 当「视觉语言」来研究多模态预训练

Amazon-FAR · hf · 2026-09-12

Amazon FAR 团队发布研究,在受控的自回归测试平台上,通过分析多模态预训练中各任务的验证损失,评估图像 tokenizer 设计如何影响文本-图像联合建模与下游性能——把图像 tokenizer 当作一种「视觉语言」来系统研究。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →