NV-Reason-CT: 3D Visual Language Model for CT Analysis
Andriy Myronenko, Dong Yang, Yucheng Tang, Baris Turkbey, Benjamin Simon, Stephanie Harmon, Rikhil Makwana, Mariam Aboian, Sena Azamat, Ibrahim Ethem Hamamci, Sezgin Er, Bjoern Menze, Zongwei Zhou, Wenxuan Li, Marc Edgar, Yufan He, Pengfei Guo, Daguang Xu
cs.CV, cs.AI
2026-09-23
NVIDIA 把原生 3D ViT 接 Qwen3.5-4B,13,824 个带显式 3D 坐标的视觉 token 全量进 LLM 读 CT,CT-RATE 分类 F1 0.614、报告 F1 0.592,权重与训练代码已开源。
CT 天然是三维的:一次检查几百张切片,病灶的形态、累及范围、左右侧别、解剖分布,全靠跨切片的空间关系拼起来。现有 CT 视觉语言模型在这个环节普遍妥协。CT-CHAT 用注意力池化把视觉特征压成 256 个 token 再交给 Llama;Jolia 更激进,整个腹部 CT 池化成一个 token;M3D-LaMed、RadFM、VoxelFM 走 Q-Former 或 Perceiver 这类一维化接口。视觉塔内部也许编码了 3D 几何,但语言解码器拿到的是展平的一维序列,深-高-宽坐标网格在里面没有显式代表。区分左右肾的病灶、描述头脚方向的累及范围,靠的恰是这类信息,而它正好在接口处被丢掉。
监督信号也有缺口。放射科报告只有结论,没有从图像走到结论的过程。直接拿报告做 SFT,模型学得到「说什么」,学不到「怎么看出来的」。
架构上的核心决定是 token 不合并、坐标跟着走。
数据约 55 万条指令样本,来自 70,111 例 CT(CT-RATE 4.7 万例、NIH 内部 1.6 万例、CancerVerse 2.3 万例)。最关键的原料是放射科医生按日常流程读片时的口述录音:转写后做直接监督,同时当范本,把源报告改写成带观察、鉴别诊断和不确定性的合成叙述,报告本身约束临床内容不跑偏。语料还配了结构化报告(胸部 9 个解剖区块、腹部 13 个)、二分类异常 QA、定位与严重度 QA、多轮追问,以及两类拒答样本(非医学请求、非 CT 输入)。
训练分两段。先端到端 SFT,编码器、投影层、语言模型一起调,学习率刻意拉开(编码器乘 0.1、投影层乘 5)。再跑 GRPO,奖励全部可验证:2.0 × 发现集合 F1 + 0.5 × 报告结构合规 + 长度惩罚(180 到 900 token 之外线性扣分),报告末尾必须带机器可读的 <answer> 标签。RL 阶段只需要异常标签,不要求每例都有专家推理轨迹。训练用 16 节点共 128 张 H100。
| 基准 | 指标 | NV-Reason-CT | 最强对照 |
| CT-RATE 分类(18 类) | macro-F1 | 0.614 | VoxelFM 0.581(另训分类头) |
| CT-RATE 分类 | macro-AUROC | 0.871 | VoxelFM 0.870 |
| CT-RATE 报告生成 | 报告派生 macro-F1 | 0.592 | CT-AGRG 0.501 |
| 初步阅片研究 | 平均解读加报告时间 | 减少 50% | 无 AI 辅助 |
0.614 是模型生成 yes/no 文本达到的,没有任务特定分类头;对照里 VoxelFM(0.581)、CT-SSG(0.572)、Pillar-0(0.544)都依赖额外训练的分类器。生成式接口在这份对比表里压过了全部监督分类方案。把逐异常提问换成一次推理列出全部异常,F1 只从 0.614 降到 0.610,推理成本低一个量级。报告生成比 CT-AGRG 高 0.09,后者本质是分类器先选阳性再逐句拼报告,内容被标签门控。外部基准上,RAD-ChestCT 分类 F1 0.766、Merlin 腹部 0.531,均列第一,协议与各自原文略有出入。
权重上了 HuggingFace,训练代码上了 GitHub,SFT 和 GRPO 两段全公开。对做医疗多模态的团队,这是少数数据构建流程、训练脚本、最终权重齐活的参考实现,4B 的体量也在可部署范围。
「全量 token 加显式 3D 坐标」是可以搬走的接口设计,与模型规模无关,Qwen 系 MRoPE 原生支持。输出侧的可审阅观察、鉴别诊断和不确定性表述,比一个分类分数更接近放射科实际工作流。时间减半如果站得住,经济价值直接。
论文自认的:裁剪启发式依赖肺可见,肺切除或显像困难时会选错区域;生成的 reasoning 定位为可审阅的临床解释,不假定忠实反映模型内部计算。
读下来的存疑:全量 token 加坐标这个核心设计没有对照消融,优势来自它还是来自 55 万条精修数据,分不开。2mm 分辨率、384mm 见方的单一 crop,意味着几毫米的小结节在 8³ patch 化后不足一个 token,细病灶检测存疑,而肺结节恰是 CT-RATE 的主要类别之一。训练含 15,991 例不公开的 NIH 内部数据,完整复现做不到。对比表的协议混杂:v1/v2 manifest、重建级与检查级、阈值与校准各不相同,CT-CLIP 原文报 0.7069 的 F1 在统一口径下重评只剩 0.398,跨表横比的风险可见一斑。AnyMC3D 的十模型集成加类别校准拿到 0.646,高于单模型的 0.614。阅片研究规模小、时间为自报,论文措辞也只到「associated with」,没下因果结论。