NVIDIA 开源 NV-Reason-CT:原生 3D 视觉语言模型读 CT 影像
NVIDIA Developer · youtube · 2026-10-09
NVIDIA 发布开源视觉语言模型 NV-Reason-CT,可原生以 3D 方式阅读胸腹部 CT 影像,逐步推理并生成报告。与多数为 2D 图像设计、只能采样少量切片或把体数据压缩成少量 token 的 VLM 不同,它采用原生 3D 视觉编码器(Primus 3D ViT)端到端连接 Qwen3.5-4B 语言模型,每个 192×192×192 crop 的全部 13,824 个视觉 token 都带 3D 位置信息输入语言模型。已在 Hugging Face 开放模型与在线 demo,并发布含 SFT 和 GRPO 微调脚本的代码仓库、医疗 AI skills 及 arXiv 论文。
「模型」频道最新
- Mistral 高管澄清:FrontierCode 由 Cognition 私有评测,样本不外泄 — b_roziere · 2026-10-09
- Google 把决策模型塞进 Chrome,实测与 Gemini Nano、Decisions API 对比 — gaganghotra_ · 2026-10-09
- 用户随手录 60 秒屏幕,Grok Bot 竟自动剪出像样的教程视频 — elonmusk · 2026-10-09
- Anthropic 使用条款被批「空泛到没有意义」:随时可封禁用户 — ivan_bezdomny · 2026-10-09
- 用户吐槽 codex 表现“如 GPT-3.5”:知识库更新后不重审结论 — Yamapama · 2026-10-09
- 置信度校准胜过准确率:Nimble 9B 自动化路由量达基座 2.7 倍 — AgitatedUsual8995 · 2026-10-09