图像生成早用 Transformer,真正特别的是自回归与纯语言预训练
benno_krojer · x · 2026-09-18
在讨论中 bennokrojer 澄清概念:Transformer 是架构,图像生成多年来早已基于 Transformer(替代方案是 CNN/U-Net);真正不寻常的是自回归这一生成目标,以及"仅在语言上预训练"这一要素。两者叠加才是当前图像生成路线的特殊之处。
「模型」频道最新
- 开源 auto-router 按实时成本路由请求:揭示暖缓存比便宜模型更值钱 — airesearch12 · 2026-09-19
- 开发者用 DeepSeek V4.1 Flash 视觉能力做出桌面健康监测开源应用 — Arindam_1729 · 2026-09-19
- Bolt:开源模型上线首周,DeepSeek V4.1 Flash 用量达 V4 Pro 十倍 — rohanpaul_ai · 2026-09-19
- Apple 团队提出 Probe Guidance,无需额外前向即可引导扩散语言模型 — itsbautistam · 2026-09-19
- 实测 typesafeai 用于软件规格质量评估:模型太小,远逊 Gemini Flash — julianharris · 2026-09-19
- 训练 AI 不再说「You're absolutely right」,最好成绩仅 52/100 — nateliason · 2026-09-19