放射学 AI 在检测胸部 X 光片、病理切片和 2D 扫描中的异常方面取得了显著进展。然而,临床上信息最丰富、数据最密集的模态之一——3D 计算机断层扫描(CT)——在现代视觉语言模型(VLM)中仍很大程度上未得到充分服务。前沿通用模型在体积成像上表现不佳,而大多数开放医学 AI 模型缺乏放射科医生信任和验证 AI 生成发现所需的多步对话深度。
NVIDIA 正通过 NV-Reason-CT 来填补这一空白,这是一个专为 3D CT 分析构建的 VLM。NV-Reason-CT 将思维链推理扩展到完整的体积 CT,生成结构化诊断报告,模拟放射科医生的内部思维,并支持跨胸部和腹部的多步后续对话。它建立在 NV-Reason-CXR 开创的推理方法论之上,该方法论已在被 RSNA 2026 接受的多人阅片临床研究中得到验证,确认在保持诊断准确性的同时节省了放射科医生的时间。
NV-Reason-CT 是一个开放的研究与开发基础;不是自主诊断系统或已获批的临床产品。它是一个AI 基础模型,专为构建专业 CT 分析应用的研究人员和开发者设计,以便针对其用例进行后训练。
为什么 3D CT 推理需要不同的方法
单次腹部 CT 检查可能包含 300–600 个轴位切片,编码了跨越三个空间维度的解剖上下文,而标准 2D 编码器根本无法从独立切片中重建这些上下文。
这种体积复杂性为医学 AI 在感知、推理和对话深度方面带来了一系列复合挑战:
感知:标准 VLM 将图像输入视为 2D 令牌网格。将 CT 体积作为独立 2D 帧的堆栈处理,会丢弃定义肿块、积液和浸润等结构的切片之间的空间关系——这些结构的形状、范围和密度只有在三维中才具有临床意义。推理:即使正确感知到异常的模型,也常常输出诊断标签而不阐明为什么。放射科医生不以标签思考——他们以系统性解剖回顾、鉴别诊断和置信度来思考。无法重现这种推理过程的 AI 无法被审计、从中学习或安全地整合到临床工作流程中。对话深度:放射科医生在审查可疑发现时不会一眼就结案。他们会提出后续问题,重新考虑鉴别诊断,并将发现跨解剖区域关联起来。大多数现有模型缺乏支持这种迭代临床推理的多轮对话能力。
为 CT 分析提供完整的 3D 推理
NV-Reason-CT 将专用的完整 3D 视觉变换器(ViT)编码器与一个语言模型相结合,该语言模型经过训练以生成思维链推理,模拟放射科医生系统分析 CT 体积的方式。
与将切片独立处理、把 2D 编码器适配到 CT 的方法不同,NV-Reason-CT 将 CT 体积作为真正的 3D 输入进行处理。这保留了穿层解剖连续性,并使模型能够整体地推理结构,就像放射科医生在浏览检查时所做的那样。
核心模型能力包括以下内容:
结构化报告生成:NV-Reason-CT 生成详细的结构化报告。NVIDIA 团队整理了一个 CT 本体,涵盖 30 种胸部异常和 29 种腹部异常,以指导和评估模型——例如肺结节、气胸、肝脏病变、肾囊肿等——其格式自然映射到临床文档工作流程。模拟放射科医生的思维链:NV-Reason-CT 还可以生成模拟放射科医生思维链的推理。该模型产生逐步的内部思考——系统地检查解剖区域、呈现相关发现、考虑鉴别诊断并阐明不确定性——其风格如同经验丰富的放射科医生在检查过程中工作。多步对话式追问:临床医生和研究人员可以就具体发现提出追问、请求对鉴别诊断的澄清,或在任何阶段探究模型的推理。这种多轮能力将 NV-Reason-CT 从报告生成器转变为交互式诊断伙伴。完整 3D ViT 编码器:专门构建的 3D 视觉编码器原生处理 CT 体积,提取基于 2D 的方法无法恢复的体积特征。此外,3D 视觉 token 网格坐标被传递给 LLM,以通过 3D MRoPE 在 LLM 各层中考虑 token 间的空间关系。这种架构选择使模型能够推理空间范围、横截面形态和层间关系——准确 CT 解读的感知基础。
NV-Reason-CT 架构如何专为体积推理而构建?
该模型架构将 Qwen3.5-4B LLM 与 3D ViT(Primus/Colipri)相结合。所有权重都在大型队列或 CT 数据上端到端重新训练,使用结构化报告、推理轨迹、多步 VQA(内部设计)。标准的基于 transformer 的 VLM 是为 2D 图像设计的。通过将体积展平为一系列 2D 切片来将这些适配到 CT,会丢失定义体积病理的空间结构。
编码器架构改编自 Primus 3D ViT,在训练前用 Colipri 权重初始化;它处理重采样为 192³ 体素、2 mm 各向同性分辨率的 CT 体积,使用非重叠的 8x8x8 patch token——产生 24x24x24 = 13,824 个视觉 token 上下文。不是合并(或缩小),所有视觉 token 都被传递给 LLM(连同它们的 3D 网格坐标)。LLM 包含 3D MRoPE,以考虑视觉 token 的 3D 空间关系。
语言模型组件被训练为以放射科医生的风格进行推理:系统地审查解剖区域,记录正常发现与异常发现,表达校准的不确定性,并得出结构化结论。该模型被设计为不是作为分类器,而是作为教师来回应:解释问题、梳理证据,并通过可见的逻辑步骤得出诊断。
NV-Reason-CT 的训练方法是什么?
基于 NV-Reason-CXR 所引入的方法,NV-Reason-CT 采用两阶段训练流程:先进行监督微调,随后进行强化学习(RL)。
阶段 1:基于放射科医生推理数据的监督微调
初始阶段在混合数据上训练模型,包括结构化报告、专家放射科医生推理标注以及通用 VQA。放射科医生为 CT 检查贡献了详细的思维链口述,记录了他们的内部审阅过程,包括他们在每个解剖区域检查什么、认为哪些发现具有显著性、权衡哪些鉴别诊断,以及如何得出最终评估。
由此形成的课程涵盖胸部与腹部区域约 550,000 个结构化 QA 示例,覆盖分区级解剖 QA、侧别特异性与定位发现 QA、严重程度级 QA 以及二分类异常识别。为提高鲁棒性,还纳入了针对无效提示和图文不匹配对的拒答示例。
训练数据包括 CT-RATE、NIH CT 数据集和 CancerVerse。该数据集补充了从大语言模型蒸馏出的高质量合成推理数据,并以专家放射科医生标注作为 grounding 示例。合并后的数据集为模型提供了丰富信号,使其了解在广泛的 CT 发现范围内,结构化放射学推理应当是什么样子。
阶段 2:面向推理质量的 RL
第二阶段使用组相对策略优化(GRPO)来提升推理质量。基于所识别异常与诊断准确性的奖励函数引导模型生成不仅结构良好、而且在临床上正确的推理。GRPO 奖励是解剖感知的。模型在每个解剖区域内因准确性而获得强化,而不是使用单一的全局信号,这改善了在整个胸腹部发现分布上的校准。
这种两阶段方法(先学习推理模式,再强化正确性)使 NV-Reason-CT 能够在多样化的 CT 表现中泛化,而无需为完整训练分布提供详尽标注的推理链。
基准测试结果
NV-Reason-CT 在领先的 3D CT 理解公开基准上取得了最先进的结果。
在 CT-RATE 这一 3D CT 理解的主要公开基准上,NV-Reason-CT 优于所有已发表基线,包括 3D 对比模型(VoxelFM、Pillar-0、CT-CLIP、Merlin)、融合 2D/3D MLLM(ClinFusion-8B)以及基于切片的 frontier 模型(MedGemma 1.5)。这是首次有单一开放模型同时实现具有竞争力的 CT 分类和报告生成。
| 模型 | 类型 | Macro-F1 | Macro-AUROC |
|---|---|---|---|
| NV-Reason-CT | 原生 3D 生成式 VLM | 0.614 | 0.871 |
| VoxelFM | 仅 3D 图像预训练 | 0.581 | 0.870 |
| Pillar-0 | 3D 对比 | 0.544 | 0.861 |
| ClinFusion-8B | 融合 2D/3D 生成式 MLLM | 0.442 | n/r |
| CT-CLIP | 3D 对比 | 0.398 | 0.733 |
| Merlin | 3D 对比 | 0.358 | 0.662 |
| MedGemma 1.5 | 最多 85 个轴位切片 | 0.303 | n/r |
表 1. CT-RATE 分类结果(18 个标签,固定统一阈值)。NV-Reason-CT 使用直接 Yes/No 提示进行评估,无分类头或任务特定适配。 除基准性能外,NV-Reason-CT 还获得了美国国立卫生研究院(NIH)放射科医生的积极临床评价,他们验证了结构化报告的质量以及思维链推理轨迹的临床合理性。
“NV-Reason-CT 提供了那种系统性的、逐步推理,反映了我们实际思考 CT 研究的方式,”美国国立卫生研究院高级临床医生、F.S.A.R.、医学博士 Baris Turkbey 说。“能够审查模型的思考过程——而不仅仅是其结论——正是让人有可能信任其发现并据此采取行动的原因。”
临床验证与实际影响
NV-Reason-CT 的价值超越了基准分数。审查过模型输出的放射科医生和临床研究人员一致强调了使其区别于早期 CT AI 系统的两项能力:
结构化报告中的时间节省:生成一份涵盖 60 多种异常的详细结构化报告非常耗时,即使对经验丰富的放射科医生也是如此。NV-Reason-CT 在几秒钟内即可生成此输出,其推理过程可供临床医生快速浏览、验证和修改——在保留放射科医生监督的同时,减少了常规报告的认知负担。支持审计的可解释性:传统医学 AI 模型输出标签或分数。NV-Reason-CT 输出其推理过程。这使得模型的结论可以以黑盒系统无法做到的方式进行审计:放射科医生可以阅读思维链,识别模型的推理在何处与自己的推理一致,并标记出分歧之处。这正是临床采用所需的透明度。
NV-Reason-CT 如何帮助研究和医学 AI?
NV-Reason-CT 旨在成为一个更广泛的医学 AI 社区可以在此基础上构建的基础。
研究人员可以使用模型检查点和后训练配方来研究医学影像中的思维链推理,在机构特定的 CT 数据集上进行微调,或将 NV-Reason-CT 集成到多模态研究流程中。用于分割和 SDG 的补充模型包括 NV-Generate-CTMR 和 NV-Segment-CTMR。
医学 AI 公司,包括放射学工作流供应商、PACS 开发者和临床决策支持平台,可以针对特定临床应用调整 NV-Reason-CT。这使得将结构化 CT 推理集成到现有的放射学审查工作流中成为可能。像 Aidoc、HOPPR、Rad AI、Mosaic Clinical Technologies 和 Raidium 这样的公司,其运营领域正需要一个功能强大、开放、对话式的 3D CT 模型来填补真正的能力空白。
NV-Reason-CT 运行与输出示例
以下示例加载 NV-Reason-CT 并对 3D CT 体积运行一次推理过程。检查点可从 Hugging Face 获取。GitHub 仓库包含推理脚本、训练配置和后训练配方。
import torch
from transformers import AutoModelForImageTextToText, AutoProcessor
model_name = "nvidia/NV-Reason-CT"
model = AutoModelForImageTextToText.from_pretrained(
model_name,
trust_remote_code=True,
attn_implementation="sdpa",
torch_dtype=torch.float16,
).eval().to("cuda")
processor = AutoProcessor.from_pretrained(model_name, trust_remote_code=True)
messages = [
{
"role": "user",
"content": [
{"type": "image"},
{"type": "text", "text": "full chest CT reasoning analysis"}
]
}
]
# Create prompt using chat template
text = processor.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=False,
enable_thinking=True
)
# Process inputs
inputs = processor(
text=prompt,
images3d=["chest_ct.nii.gz"],
anatomy_region="chest",
return_tensors="pt",
).to(model.device)
# Generate chain-of-thought reasoning and structured report
with torch.inference_mode():
generated_ids = model.generate(
**inputs,
max_new_tokens=4096,
do_sample=False,
use_cache=True,
)
# Decode
new_tokens = generated_ids[:, inputs.input_ids.shape[1]:]
response = processor.batch_decode(
new_tokens,
skip_special_tokens=True,
clean_up_tokenization_spaces=False,
)[0]
print(response)
输出摘录
<think> 我将系统地审阅CT容积,使用有效的技术背景,识别关键的影像学发现,然后提供最终标签。 </think>
我们将以系统的方式审阅这份胸部静脉对比增强CT。
首先,一个重要的技术和支持装置细节:存在左侧输液港导管,导管尖端终止于上腔静脉,这是预期的中心静脉位置。
我将从肺部和气道开始。中央气道通畅,因此没有明显的气管或主支气管阻塞。然而,当我们向下进入右肺时,右肺下叶是主要异常所在。右肺下叶有一个大的肿块样病变,并伴有右肺下叶的部分塌陷。这是一个有意义的发现,因为肿块伴有阻塞后或相关的体积丧失,令人担忧恶性病变。
右肺下叶还有一个额外的肿块样病变[...]。
因此总体而言,主要的胸部发现是右肺下叶大的肿块相关部分塌陷,伴有额外的右肺下叶肿块样病变以及纵隔和右肺门的大块淋巴结肿大。该模式令人担忧胸部恶性肿瘤伴淋巴结受累。此外还有散在的双侧磨玻璃影,仍属非特异性,可能是炎性、感染性或肿瘤性。
此外,还有下胸椎溶骨性病变伴中度椎管狭窄,以及少数性质不确定的右侧肋骨硬化性病变。
NV-Reason-CT 如何融入 NVIDIA 医疗 AI 生态系统
NV-Reason-CT 是 NVIDIA 医疗 AI 系列开放医疗 AI 模型的一部分,旨在跨放射学工作流程协同工作:
:合成逼真的 3D CT 和 MRI 体数据,用于训练数据增强和研究NV-Generate-CTMRNV-Segment-CTMR:从 3D CT 和 MR 体数据中自动分割器官和病灶NV-Reason-CXR:胸部 X 光分析的思维链推理NV-Reason-CT:完整 3D CT 分析的思维链推理
这些模型共同为端到端放射学 AI 流水线提供了构建模块——从合成数据生成,到分割,再到透明、对话式的临床推理。
探索 NVIDIA 医疗 AI 生态系统以了解更多。
开始使用 NV-Reason-CT 进行放射科医生思维链推理
NV-Reason-CT 将思维链推理引入医学中信息密度最高的模态之一。通过将专用的完整 3D ViT 编码器与经过推理训练的语言模型相结合,该系统为 CT 体数据生成结构化诊断报告和逐步的放射科医生式思考——涵盖胸部和腹部发现,并支持多轮对话。
通过订阅* NVIDIA 新闻保持更新,并在** LinkedIn、** X 和** YouTube 上关注 NVIDIA 医疗健康。*
