Amazon 研究:把图像 tokenizer 当「视觉语言」来研究多模态预训练
Amazon-FAR · hf · 2026-09-12
Amazon FAR 团队发布研究,在受控的自回归测试平台上,通过分析多模态预训练中各任务的验证损失,评估图像 tokenizer 设计如何影响文本-图像联合建模与下游性能——把图像 tokenizer 当作一种「视觉语言」来系统研究。
「多模态」频道最新
- Maestro 视频换角色实操:两种上传首帧方案提升精确度 — cocktailpeanut · 2026-09-12
- 本地视频工具 Maestro v2.1 上线:一键换角色,6GB 显存可跑 — cocktailpeanut · 2026-09-12
- Maestro v2.1.6 发布:Viggle 视频换角色提速省显存 — cocktailpeanut · 2026-09-12
- Maestro 新版支持本地视频换人:Viggle-Animate 免费跑在自家电脑 — cocktailpeanut · 2026-09-12
- AI 艺术家 Grant Hawkins 发布新短片《2nd period English》 — granawkins · 2026-09-12
- LiteReality-Agent 开源:把房间扫描变成可物理仿真 3D 场景 — elliottszwu · 2026-09-12