Adaptive Color Grading
Trevor D. Canham, Abhijith Punnappurath, Michael S. Brown
eess.IV, cs.CV
2026-09-18
三星多伦多与约克大学标注 1564 帧四档影调分区阈值,用亮度直方图 KNN 预测门槛。评测色偏固定时,remainder→NYC 上 ΔE00 为 2.40、PSNR 36.77,超过固定 LUT、U-Net 和 NILUT。
调色师靠影调分区干活:暗部、亮部、最暗、最亮分开推颜色,画面才有体积感。商业工具里这些分区要么写死阈值,要么按分位数切。一套为 A 片调好的静态 3D LUT 套到 B 片上,阴影该蓝的地方会糊进中间调。
端到端增强网络走另一条路:直接学输入到成片。它们把曝光、对比、局部遮罩和风格一次学完,却很少检查「分区有没有切对」。主观风格本身也不适合作像素回归。
缺的是一套可解释、可复用的核心旋钮:只要影调分区阈值(TRT)能跟着画面走,后面的分区着色就可以沿用。
先做开源调色工具。影调用 mean(R,G,B) 切成两对重叠区,暗/最暗和亮/最亮,每对一个阈值加固定斜率的软过渡。用户给四个区各加 CIELAB ab 偏置,嵌套进 17³ 的 3D LUT,一次套到图上。
用这套工具在 HDR Videographic Survey 上标了 782 个镜头、每镜两帧,共 1564 张 DCI 2K。来源覆盖多伦多、犹他、阿拉斯加、西雅图、伦敦、纽约 44 个场景。标注意图固定:拉开直射与阴影的色差,并用最暗/最亮保护黑位、灯、高光和天空。很多图存在反射率歧义、雾、大半影,分区是病态问题。
然后只预测四个 TRT,色偏全部钉死:最暗 {0,-10}、暗 {0,10}、亮 {0,-10}、最亮 {0,10},大致蓝阴影、黄直射。四种应用向策略:
端到端对照是 U-Net、NILUT、NamedCurves,在 NYC / Night 与其余数据的双向划分上训练。
主表同时报 ΔE00(越低越好)和 PSNR。KNN 四组划分全胜。
| 方法 | remainder→NYC ΔE00 / PSNR | NYC→remainder | remainder→Night | Night→remainder |
| U-Net | 2.96 / 34.90 | 3.83 / 33.15 | 2.99 / 36.22 | 2.81 / 36.19 |
| NamedCurves | 3.44 / 32.86 | 4.02 / 32.44 | 4.85 / 30.99 | 3.83 / 32.68 |
| NILUT | 2.65 / 35.46 | 2.86 / 35.80 | 1.62 / 40.84 | 2.56 / 36.87 |
| Fixed | 3.25 / 34.16 | 3.56 / 34.39 | 1.81 / 40.47 | 2.96 / 35.90 |
| MLP | 3.41 / 33.71 | 3.15 / 35.24 | 2.10 / 38.13 | 3.68 / 33.00 |
| KNN | 2.40 / 36.77 | 2.55 / 37.53 | 1.47 / 42.94 | 2.50 / 37.26 |
MLP 和分位数往往不如固定 LUT。相关图上,固定策略是横带,分位数被直方图比例牵着走,MLP 接近圆团,KNN 把四档阈值拉开。观感上只有 KNN 还能保住黄蓝分区,其余容易整图偏色。NILUT 数字好于静态 LUT,画面更像不敢动输入。
这是一次对「固定门槛 / 分位数就能切照明区」的规模检验,结论是分位数最差,固定还凑合,真正能过静态 LUT 的是 KNN。对做相机管线和后期工具的人,含义很具体:先把核心旋钮标出来再学,比端到端吞掉整个调色更可解释,也更适合端侧个性化。训练在 CPU 上分钟级,KNN 查询 0.1 s。
它是渐进改进,而且实验把色偏钉死了,比真实调色流程窄。
标注来自单人、一种创作意图,TRT 只是调色流程里的一组旋钮。色偏在评测里固定,模型没有学「该往哪边推颜色」。端到端方法拿不到开源工具里的软过渡函数,对比不完全对称。数据是 HDR 转 P3D65 后再标,部署到手机 JPEG 或 LOG 素材要重新标定。论文提到可向局部区域和运动影像扩展,正文没有做。