NVIDIA 发布 NV-Reason-CT:单张 CT 喂出 13824 视觉 token
techwith_ram · x · 2026-09-27
NVIDIA 发布 3D 医学 AI 模型 NV-Reason-CT,让 LLM 对单张 CT 影像进行推理,一次输入 13,824 个视觉 token。
架构细节:语言主干为 Qwen3.5-4B,3D 视觉编码器 Primus 由 COLIPRI 初始化;输入为单通道胸部或腹部 CT(.nii / .nii.gz),预处理采用 LPS 方向、2mm 各向同性重采样及解剖感知的 192×192×192 体素裁剪;patch 网格为 24×24×24(不重叠的 8×8×8 patch),所有 13,824 个投影视觉 token 不做空间合并直接送入语言模型,位置编码采用深度/高度/宽度三维 MRoPE。
模型已在 GitHub 与 Hugging Face 开放。
「模型」频道最新
- Reddit 用户吐槽:Gemini 完全没有对话时间流逝概念 — Putrid_Draft378 · 2026-09-28
- 实验者称持续运行的 AI 实例偏好与其私聊,且现长上下文退化迹象 — repligate · 2026-09-28
- Anthropic Opus 新模型发布数天,已有 10 个玩法案例 — FinanceYF5 · 2026-09-28
- 博主实测:Opus 5.5 用量比 Codex 上的 Astra 划算得多 — RexDouglass · 2026-09-28
- 游戏手感成 LLM 短板:开发者自建 gamefeel 私有基准测模型 — teortaxesTex · 2026-09-28
- 用 LLM logprobs 做概率编程:微调破坏校准,新模型或使其再可用 — xuanalogue · 2026-09-28