NVIDIA 开源 NV-Reason-CT:原生 3D 视觉语言模型读 CT 影像

NVIDIA Developer · youtube · 2026-10-09

NVIDIA 发布开源视觉语言模型 NV-Reason-CT,可原生以 3D 方式阅读胸腹部 CT 影像,逐步推理并生成报告。与多数为 2D 图像设计、只能采样少量切片或把体数据压缩成少量 token 的 VLM 不同,它采用原生 3D 视觉编码器(Primus 3D ViT)端到端连接 Qwen3.5-4B 语言模型,每个 192×192×192 crop 的全部 13,824 个视觉 token 都带 3D 位置信息输入语言模型。已在 Hugging Face 开放模型与在线 demo,并发布含 SFT 和 GRPO 微调脚本的代码仓库、医疗 AI skills 及 arXiv 论文。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →