三星 KNN 预测四档影调阈值,自适应调色超过 U-Net 与 NILUT

Adaptive Color Grading

Trevor D. Canham, Abhijith Punnappurath, Michael S. Brown

eess.IV, cs.CV

2026-09-18

三星多伦多与约克大学标注 1564 帧四档影调分区阈值,用亮度直方图 KNN 预测门槛。评测色偏固定时,remainder→NYC 上 ΔE00 为 2.40、PSNR 36.77,超过固定 LUT、U-Net 和 NILUT。

这篇在解决什么

调色师靠影调分区干活:暗部、亮部、最暗、最亮分开推颜色,画面才有体积感。商业工具里这些分区要么写死阈值,要么按分位数切。一套为 A 片调好的静态 3D LUT 套到 B 片上,阴影该蓝的地方会糊进中间调。

端到端增强网络走另一条路:直接学输入到成片。它们把曝光、对比、局部遮罩和风格一次学完,却很少检查「分区有没有切对」。主观风格本身也不适合作像素回归。

缺的是一套可解释、可复用的核心旋钮:只要影调分区阈值(TRT)能跟着画面走,后面的分区着色就可以沿用。

方法

先做开源调色工具。影调用 mean(R,G,B) 切成两对重叠区,暗/最暗和亮/最亮,每对一个阈值加固定斜率的软过渡。用户给四个区各加 CIELAB ab 偏置,嵌套进 17³ 的 3D LUT,一次套到图上。

用这套工具在 HDR Videographic Survey 上标了 782 个镜头、每镜两帧,共 1564 张 DCI 2K。来源覆盖多伦多、犹他、阿拉斯加、西雅图、伦敦、纽约 44 个场景。标注意图固定:拉开直射与阴影的色差,并用最暗/最亮保护黑位、灯、高光和天空。很多图存在反射率歧义、雾、大半影,分区是病态问题。

然后只预测四个 TRT,色偏全部钉死:最暗 {0,-10}、暗 {0,10}、亮 {0,-10}、最亮 {0,10},大致蓝阴影、黄直射。四种应用向策略:

端到端对照是 U-Net、NILUT、NamedCurves,在 NYC / Night 与其余数据的双向划分上训练。

结果

主表同时报 ΔE00(越低越好)和 PSNR。KNN 四组划分全胜。

方法remainder→NYC ΔE00 / PSNRNYC→remainderremainder→NightNight→remainder
U-Net2.96 / 34.903.83 / 33.152.99 / 36.222.81 / 36.19
NamedCurves3.44 / 32.864.02 / 32.444.85 / 30.993.83 / 32.68
NILUT2.65 / 35.462.86 / 35.801.62 / 40.842.56 / 36.87
Fixed3.25 / 34.163.56 / 34.391.81 / 40.472.96 / 35.90
MLP3.41 / 33.713.15 / 35.242.10 / 38.133.68 / 33.00
KNN2.40 / 36.772.55 / 37.531.47 / 42.942.50 / 37.26

MLP 和分位数往往不如固定 LUT。相关图上,固定策略是横带,分位数被直方图比例牵着走,MLP 接近圆团,KNN 把四档阈值拉开。观感上只有 KNN 还能保住黄蓝分区,其余容易整图偏色。NILUT 数字好于静态 LUT,画面更像不敢动输入。

为什么重要

这是一次对「固定门槛 / 分位数就能切照明区」的规模检验,结论是分位数最差,固定还凑合,真正能过静态 LUT 的是 KNN。对做相机管线和后期工具的人,含义很具体:先把核心旋钮标出来再学,比端到端吞掉整个调色更可解释,也更适合端侧个性化。训练在 CPU 上分钟级,KNN 查询 0.1 s。

它是渐进改进,而且实验把色偏钉死了,比真实调色流程窄。

局限与存疑

标注来自单人、一种创作意图,TRT 只是调色流程里的一组旋钮。色偏在评测里固定,模型没有学「该往哪边推颜色」。端到端方法拿不到开源工具里的软过渡函数,对比不完全对称。数据是 HDR 转 P3D65 后再标,部署到手机 JPEG 或 LOG 素材要重新标定。论文提到可向局部区域和运动影像扩展,正文没有做。

术语

原文与代码

社区讨论

相关论文

全部论文解读