对象级hex监督加高噪声纯色锚点,8B生成色准相对涨85%

Paint-Anything: Unified Any-Color Control for Image Generation and Editing

Ji Xie, Dewei Zhou, Xinyu Huang, Zhennan Chen, Xun Wang

cs.CV, cs.AI, cs.LG

2026-09-18

字节跳动把对象级hex监督和高噪声纯色锚点做成同一套提示词接口,微调后的八B模型在自建色准榜上生成分从37.02提到68.58,改色分从58.90提到75.57。

这篇在解决什么

专业设计要的是任意 24 位 hex 落到指定物体上。现有图像模型能画出像样的场景,但把 #10A9FF 写进提示词后,物体颜色经常只是语义上像,数值差得很远。此前的做法要么加专用颜色编码器、可学习颜色 token,要么在推理时做采样引导或注意力干预。这些路径难跨架构、难覆盖全部约 1670 万种颜色,生成、上色、编辑还常被拆成三套系统。

ByteDance Seed、浙江大学和南京大学把 any-color control 收成同一套提示词接口:在文本里直接写 <color> #AABBCC </color>,同一份微调权重同时做文生图和物体改色。

方法

底座是 rectified-flow 文生图模型。主实验用 FLUX.2-klein-base-4B(DiT 约 4B,连 Qwen3 文本编码器总计约 8B),VAE 和文本编码器冻结,只训去噪 Transformer。生成和编辑共用 flow-matching 损失,编辑样本额外把源图的干净 latent 拼进序列。

监督来自 Paint-500K。内部图文对经 VLM 找物体、SAM3 出 mask,再在 CIELAB 里用 MeanShift 抽主色,写成 hex 并绑回名词短语。固定 K 的 k-means 容易把阴影切成多余颜色,MeanShift 按分布自适应簇数。400K 条 T2I(10 万单物体、30 万多物体)加上 10 万条编辑对。编辑源图由预训练编辑模型改色生成,目标仍是原始照片,避免目标带生成痕迹。

真实照片的标签只能近似颜色,阴影会把同一物体映射到一串 RGB。补救是纯色锚点:采样 24 位 RGB,渲成纯色图,配对 hex 提示。这些样本只在高噪声时段训练,默认门限 tgate=0.8,低噪声留给自然图像。消融显示,不设门限时生成变好、编辑变差;加上门限后两边一起涨。

结果

自建 ACBench 用 SAM3 框出目标物体,算区域平均 sRGB 相对目标 hex 的 MAE,再映射到 0–100 分:通道平均误差不超过 16 满分,至少 64 零分。

模型ACBench-T2IACBench-EditCompColor-hex 均分
FLUX.2-4B 基座37.0258.900.38
Paint-Anything68.5875.570.79
FLUX.2-dev(总参 56B)51.7068.87

相对基座,生成分涨 85.3%,编辑分涨 28.3%。8B 微调后超过同系列 56B。CompColor 上,基座把颜色名换成 hex 后均分从 0.72 掉到 0.38;微调后 hex 均分到 0.79,颜色名均分也从 0.72 升到 0.79。独立 GenColorBench NCU:基座 34.00,微调 57.89,高于已发表的 FLUX+NumColor 51.90。15 人对 80 条 T2I 的 1200 次判断里,微调赢 55%、平 32%、输 13%。

全量微调明显强过 rank-256 LoRA(T2I 68.58 vs 48.45)。去掉纯色锚点、只加 color 标签,T2I 57.16、编辑 73.89;再加锚点并设门限才到完整配方。Z-Image Base 用同一配方,T2I 从 33.45 到 53.77。

为什么重要

品牌色、电商 SKU 图这类需求,以前要专用模块或推理时优化。这篇证明:对象级 hex 监督加高噪声纯色锚点,就能把控色收进普通提示词,生成和编辑共用一套权重。从业者可以直接试 FLUX.2-4B 这条配方,不必先上 50B 级模型。这是明确的微调配方改进,不是新生成范式。

局限与存疑

训练数据没有调色板级监督,多色板、跨物体共享色板还没覆盖。ACBench 的分数依赖分割质量和区域均值,纹理、高光、半透明物体可能被均值抹平。编辑源图由模型合成,真实用户图分布未必对齐。NumColor 没有可跑的推理代码,NCU 对照引用的是原文数字。用户研究只覆盖 T2I,且参与者和 prompt 重复出现,不能当成逐样本人机一致性。

术语

原文与代码

相关论文

全部论文解读