Resolution-Agnostic Neural Operators for Multi-Rate Sparse-View CT
Aujasvit Datta, Jiayun Wang, Asad Aali, Anima Anandkumar
eess.IV, cs.CV
2025-12-13
Caltech等提出CTO,用DISCO神经算子在正弦图与图像双域重建稀疏CT。单模型覆盖9到72视角,AAPM上比同结构CNN平均高3.4dB,推理比扩散快500倍以上。
稀疏视角 CT 用更少的 X 射线投影重建切片,剂量和扫描时间都能压下来。投影一少,Radon 变换的逆就变成病态问题,滤波反投影(FBP)会拉出一圈条纹伪影。
深度学习把伪影压下去了,但绝大多数网络绑死在一个采样率上。卷积核是按固定网格尺寸学的,视角从 72 掉到 18,感受野相对物体的覆盖就变了。LEARN 只在 72 视角上训、拿到 18 视角上测,PSNR 从 32.32 dB 掉到 4.16 dB。临床里不同器官、不同协议的采样率本来就不一样,为每个设置各训一个模型,扩不出去。
CTO 把重建从离散网格上的网络改成函数空间上的算子。正弦图 p(θ, r) 和图像 x(x, y) 都被当成连续函数,网格只是采样。换采样率等于换离散化,同一个算子接着用。
骨架仍是解卷网络(unrolled network):3 个 cascade,每个 cascade 做一次物理一致性更新,再过一个图像域神经算子 NOi。前面先接一个正弦图域算子 NOs。原来的 CNN 先验换成 DISCO(discrete-continuous convolution)。
DISCO 的核定义在连续函数空间里,用分段线性基展开,推理时才按当前网格离散化。分辨率变高,核的物理覆盖范围不变,不会像 CNN 那样感受野相对变小。这就是离散化收敛:网格加密,逼近误差有界并趋向零。
两个设计把 CT 的物理嵌进去了。
NOs 工作在极坐标 (r, θ) 上,分空间支路和频率支路。频率支路沿探测器轴 r 做一维傅里叶变换,再过 U 形 DISCO 块(UDNO)。这对应傅里叶切片定理:正弦图沿 r 的频谱就是物体二维频谱的极坐标采样。两路输出取平均。θ 方向用带翻转的循环填充:θ 和 θ+180° 的投影沿 r 翻转后等价,旋转物体等于正弦图沿 θ 平移,网络对旋转是等变的。
NOi 在笛卡尔网格上用同样的 UDNO,补局部高频细节。数据一致性项保留带掩膜 Radon 变换的伴随,物理约束没有丢掉。
所有学习方法都用同一份多采样率数据训练:9 / 18 / 36 / 72 视角在每个 batch 里均匀抽取。AAPM 腹部低剂量 CT(测试 526 张切片)上,CTO 压过同结构解卷 CNN 和扩散模型:
| 方法 | 18 视角 PSNR | 36 视角 | 72 视角 | 18 视角 RMSE (HU) |
| FBP | 13.14 | 13.36 | 13.82 | 632.58 |
| DPS(扩散) | 25.68 | 29.13 | 31.64 | 149.97 |
| GloReDi | 29.47 | 31.74 | 32.96 | 96.89 |
| 解卷 CNN | 29.14 | 31.76 | 33.35 | 100.65 |
| CTO | 31.57 | 35.06 | 37.88 | 75.97 |
相对同结构 CNN,18 / 36 / 72 视角分别高 2.43 / 3.30 / 4.53 dB,平均约 3.4 dB;相对 DPS,腹部大约高 6 dB。A100 上推理 0.065 秒,DPS 要 51.58 秒,ALD 要 32.72 秒,至少快 500 倍,而且不用按采样率调超参。
肾脏 CT 1 万张测试切片上,CTO 在 18 / 36 / 72 视角分别到 36.17 / 38.76 / 40.97 dB,解卷 CNN 是 32.56 / 34.37 / 35.60 dB,平均大约高 4 dB。零样本超分也成立:图像从 256 提到 512,比 CNN 高 3 dB;正弦图从 72×672 提到 144×1344,比 CNN 高 3.7 dB。
拆掉 NOs 掉 4.82 dB,拆掉 NOi 掉 3.86 dB;正弦图频率支路值 2.7 dB,循环填充在 24 视角上再贡献 0.83 dB(33.00 vs 32.17)。跨数据集(肾训腹测)比 CNN 高 9.8 dB,加泊松噪声(I0=10^6)仍高 3.06 dB。LIDC-IDRI 肺 CT 上相对 CNN 在 18 / 36 / 72 视角分别高 1.54 / 2.47 / 3.29 dB。
对做医学影像重建的人,这篇把「一个协议一个模型」换成「一个算子覆盖一簇协议」。临床扫描参数经常改,维护四套权重不现实。推理时 DISCO 核预先离散化,FLOPs 与卷积相同;比扩散快两个数量级,这才像能进扫描室的东西。
对做神经算子的人,FNO 那种全局卷积不适合重建:每个像素被全图混一遍,边会被抹掉。DISCO 用紧支撑核,推理复杂度和 CNN 一样,但保留离散化收敛。代码在 neuraloperator/sparsect。
这是渐进工作。解卷骨架、双域、数据一致性都不是新的。新的是先验从离散卷积换成函数空间算子,以及正弦图上的旋转等变填充。多采样率联合训练本身就能缓解过拟合(LEARN 在 18 视角从单率 4.16 dB 拉到联合训练 25.51 dB),CTO 是在已经联合训练的基线上再拉开差距。
论文把三维 CT、更贴近临床的数据、不确定性和更多扫描协议列为后续工作。实验建立在平行束 Radon 模型上,真实 CT 多是扇束或锥束,几何差一截。稀疏视角是从全采样数据里均匀抽角度模拟的,不是真机稀疏采集。
超分对照的「高分辨率真值」是双线性插值出来的,不是更高采样的扫描,数字会偏乐观。解卷 CNN 的参数量因核配置和 CTO 不完全一致,3.4 dB 不能全部算在函数空间头上。肾脏上扩散模型只评了 500 张(算力原因),和 1 万张主表不对齐。单采样率分别训练时 CTO 仍领先,但 18 视角只比 CNN 高 1.59 dB(33.94 vs 32.35),优势明显缩水。9 视角极端稀疏时,相对最强单次前向方法 GloReDi 只高 0.75 dB(27.87 vs 27.12)。没有放射科医生读片,PSNR / SSIM / HU 误差不等于诊断可用性。