Krea 2 训练复盘:数据就是一切,拒绝 AI 生成图
AI Engineer · youtube · 2026-08-18
Krea 联合创始人 Sangwu Lee 的演讲,讲 Krea 2(medium 已开源)的生成模型训练取舍与数据工程细节。
核心观点
- 生产级图像模型为一致性付出代价:想要稳定输出,就得渲染「最平庸的普通人」放在画面中央;而 Krea 2 反向优化,追求快速生成和风格广度,让还没想清楚要什么的工作室能真正探索。
数据工程(重点)
- 架构锁定后,「数据基本就是一切」。
- 训练数据里的坑:拍摄墙上挂的画作是合格数据,但打标器总是漏掉画框和白墙,模型于是学会给每张生成的画都挂上框。
- 坚决不用 AI 生成图训练:审美会「粘」在模型上,等于继承别人的模型。
- 去重流程:先在 20-100 亿张图上做哈希去重,再用 embedding 找近重复。
- 把大 VLM 的判断蒸馏成足够便宜的分类器,才能扫完十亿级图片。
- 稀疏自编码器顺便充当无监督打标系统,抓水印和边框伪影。
- 用按 PageRank 排序的 Wikipedia 概念检查世界知识覆盖度;全流程共 30-40 个内部过滤器。
- 训练管线整体从 LLM 领域照搬;技术栈正在倒退回 DALL-E 2 时代的方向。
「多模态」频道最新
- AI 生成夜场景中肌肉车的视觉演示 — cyberpunk790 · 2026-08-18
- 实测 Minimax MMH3:指令遵循极强,但画面质感仍逊于 SD2.5 — AdmirablePainting368 · 2026-08-18
- AI 混剪:混乱片场中的汉堡玩偶 POV — Any-Scar765 · 2026-08-18
- Seedance 2.5 演示:每秒变形的科幻载具 — umesh_ai · 2026-08-18
- 实测 ComfyUI 实现 LTX 2.5 原生 DFR 渲染管线 — gamaraala1 · 2026-08-18
- 零 AE 用 Claude 做出电影感广告,作者开源整个工作流插件 — BiosRios · 2026-08-18