A Multicenter Benchmark and Clinically Structured Metric for Coronary CTA Report Generation
模型/指标结构
- 输入为患者级 3D CCTA 序列,基准统一评估 7 个开源 3D 医学视觉语言模型生成的报告。
- CSMCCTA 先用临床规则与关键词抽取,把报告转成患者级、血管级及“血管—节段—异常—严重度”四元组。
- 根据参考报告与预测报告共同支持的最细解剖层级进行比较,避免报告粒度不一致造成不公平惩罚。
- 各临床变量以 F1 计分,再用 70 例专家评分拟合非负权重;另留 30 例作不重叠验证。
数据与优势
四院共 818 个患者—报告对、3,021 个 CTA 序列。指标不只衡量文字相似度,而是显式检查冠脉位置、斑块类型、狭窄程度及报告层级。它与专家评分的相关系数为 0.97,高于 13 个文本或医学报告指标;同义表述替换时分数不下降,逐步删减临床信息时分数随之降低。
结果与临床边界
CCTA 专用 C2RG 在四院均排名最高,CSMCCTA 分别为 0.456、0.520、0.355 和 0.479,但距离理想表现仍远。部分通用模型生成的无关报告比例最高达 98.7%。这是报告生成与评价研究,并非对冠心病未来事件的预测,也未验证自动报告能否改善诊断或治疗结局。
短板
专家权重来自单中心 100 例内部样本,虽然 30 例与拟合样本不重叠,但不是独立外部专家验证。参考报告本身存在完整性和颗粒度差异;四院数据未公开。模型排名只适用于当前 7 个模型和本基准,不能外推为通用优劣结论。
中文摘要
这项中国多中心研究建立了冠脉 CTA 自动报告基准,并提出按患者、血管和冠脉节段分层的临床结构化指标。指标把自由文本转为可核对的临床变量,再在双方共同支持的解剖层级上比较,因而比 BLEU、ROUGE 或单纯语义相似度更能识别位置和严重度错误。四院数据证明 CCTA 专用模型明显优于通用 3D 模型,但总体性能仍不足以支持临床自动化。研究的突出价值是把“报告写得像不像”推进到“临床事实是否在正确位置且严重度正确”。
English summary
This multicenter study introduces a benchmark for coronary CTA report generation and a clinically structured metric that converts free text into patient-, vessel-, and segment-level variables. Scoring is performed at the finest anatomical level supported by both reports, with expert-calibrated non-negative weights. The metric correlated strongly with held-out expert ratings and was robust to equivalent wording while responding monotonically to omitted clinical information. A CCTA-specific model ranked best at all four hospitals, whereas several generalist 3D models often produced irrelevant reports. The study evaluates report fidelity, not diagnosis, prognosis, or downstream patient benefit.