DAILY MEDICAL MODEL INTELLIGENCE

医学算法前沿简报

按病种与任务分栏,重点拆解模型结构、适用优势、验证边界和复现资源。每篇附中英文摘要式概述。

2026-09-01本期 4 篇含中国大陆团队PDF / 代码 / 权重 / 数据逐项核验
本期说明:第 2 篇属于近 7 天新增,其余为与各病种栏高度相关的背景研究。后续日报优先选择当天或近 7 天论文;双语内容均为重新撰写的摘要式概述,不复制原摘要。

01|眼底 × 心肌梗死 / 脑卒中

纵向眼底基础模型与未来 5 年事件预测

中国大陆团队参与 · 已发表

RETFound Plus:把同一只眼的时间变化编码进基础模型

npj Digital Medicine · 2026 · 未来 5 年 MI、脑卒中及慢病风险
4/5资源完整度

模型结构主线

同眼多次 CFPViT 学生网络EMA 教师网络MIM + 全局时间一致性伪生存分析头

学生端接收遮挡图像,教师端接收完整图像;通过重建损失学习局部结构,通过跨时间一致性损失学习同一人的视网膜演变。优势是从“单次分类”转向带删失信息的发病与进展预测。

预训练规模1,304,292 张 CFP;304,345 人
微调队列11,938 人,年度随访
代表结果MI 内部 5 年 c-index 0.944
外部验证英国、美国、新加坡、香港、丹麦
中文摘要式概述

研究用大规模纵向眼底照片训练时间感知基础模型,再对心肌梗死、脑卒中、高血压、糖尿病、肾病和眼病的 5 年发病或进展进行微调。相较横断面 RETFound,模型在多个全身疾病任务上提高了风险区分度,并在多地区外部队列中保持总体趋势。优势来自对同一眼随时间变化的显式建模;局限是回顾性队列、临床数据受限,以及尚无前瞻性决策获益验证。

English summary

This study trains a time-aware retinal foundation model on repeated fundus photographs from the same eye. A teacher–student objective combines masked reconstruction with temporal representation consistency, followed by pseudo-survival fine-tuning for five-year disease outcomes. The model improves discrimination for myocardial infarction, stroke, hypertension, and diabetes across several external cohorts. Its main contribution is trajectory-aware representation learning; prospective evaluation and accessible clinical datasets remain missing.

结构优势

适合有重复眼底随访、终点带发生时间和删失信息的项目;比只看基线单图更贴近慢病演变。

复现门槛

预训练曾使用 6×A800 80GB;仅微调可显著降低算力,但需要时间到事件标签。

02|眼底 × 高血压 / 糖尿病 / 慢性肾病

最新比较研究:基础模型并非在所有数据规模上都占优

近 7 天新增 · 已发表

RETFound 与 ResNet、ViT、SwinV2 的标签效率比较

The Lancet Digital Health · 2026-08-28 · 横断面疾病检测
3/5资源完整度

模型结构主线

224×224 CFPRETFound ViT-L / ResNet50 / ViT-B / SwinV2任务分类头

研究本身没有提出新骨干,而是控制微调设置和标签量做公平比较。最大价值在于回答“何时需要基础模型”:全量眼病数据下传统网络接近 RETFound,小样本全身疾病任务中视网膜专用预训练更稳。

任务4 类眼病 + 3 类全身疾病
小样本设置100、200、400 张等
代表结果100 张高血压:RETFound AUC 0.705
关键边界检测现病,不是未来发病预测
中文摘要式概述

研究在多种眼病和全身疾病检测任务上比较 RETFound 与三种 ImageNet 预训练模型,并系统缩减微调标签量。标签充足时,各模型在眼病任务上的差异有限;标签降至数百张且任务涉及高血压、糖尿病或慢性肾病时,RETFound 更具优势。结果支持把视网膜基础模型用于标注稀缺场景,但外部 AUC 仍可能偏低,不能直接推导出临床筛查价值。

English summary

This retrospective benchmark compares a retina-specific foundation model with standard ImageNet-pretrained backbones across ocular and systemic disease detection. Performance is similar on several ocular tasks when full labels are available, while RETFound is more label-efficient for systemic disease detection with only hundreds of images. The work supports selective rather than universal use of retinal pretraining. External discrimination remains modest, and the endpoints are cross-sectional rather than future clinical events.

核验说明:公开的是 RETFound 通用代码、权重和公开数据划分;未核验到本文完整实验流水线的独立仓库,因此不能把骨干仓库等同于本文可一键复现。

03|OCT × AMD / 青光眼

从中心切片升级为完整三维体积建模

眼科影像 · 已发表

用视频基础模型读取完整 3D OCT 体积

npj Digital Medicine · 2026 · AMD 与青光眼性视神经病变
4/5资源完整度

模型结构主线

OCT 多 B-scan按帧组成“视频”V-JEPA 时空 ViT跨切片交互分类探针

关键创新不是新的眼科损失,而是改变输入范式:不再只用中央切片,而让视频模型在潜在空间中建模相邻 B-scan 的三维关系。平均 AUROC 约 0.94,高于最佳单图模型约 0.90。

数据5 个 OCT 队列、4 个地区
比较模型RETFound、VisionFM、DINOv2、3D CNN
优势保留层间连续性和体积病灶范围
代价显存、I/O 和协议异质性更高
中文摘要式概述

研究把完整 OCT 体积视作视频序列,用 V-JEPA 编码切片间关系,并与只使用中心 B-scan 的多种图像基础模型及 3D CNN 比较。体积范式在多数数据集上取得更高判别性能,说明单张切片会丢失有价值的三维结构。研究开放了实验代码,并使用多个公开数据集;但部分临床队列需申请,且视频模型的计算负担和设备域偏移仍是部署障碍。

English summary

The study treats a three-dimensional OCT scan as a video and applies V-JEPA to learn interactions across neighboring B-scans. It benchmarks this volumetric approach against central-slice retinal foundation models, DINOv2, and a 3D CNN on multiple AMD and glaucoma datasets. Volumetric representation generally improves discrimination by preserving inter-slice context. Reproduction is supported by released code and public datasets, although some cohorts require permission and compute demands are higher.

权重说明:链接为 V-JEPA 官方基础权重集合;未确认论文所有下游微调检查点均公开。

04|心电 × 多模态推理

中国大陆团队:从分类器升级为有证据约束的 ECG 解读模型

北京大学团队 · ICML 2026

ECG-R1:协议引导、模态解耦与证据奖励

ECG 信号 + 心电图图像 + 文本推理 · 9B 参数公开权重
5/5资源完整度

模型结构主线

ECG 波形 / 图像模态解耦编码Interleaved Modality DropoutQwen3-VL 8B诊断证据奖励 RL

模型先用临床协议和定量阈值生成结构化指令数据,再通过模态交替缺失训练增强波形或图像单独缺失时的鲁棒性,最后用诊断证据奖励约束推理,目标是减少“听起来合理但证据不足”的回答。

模型规模约 9B,BF16 权重约 17.8GB
开放数据约 119 万条记录,基础子集 3 万
核心优势同时支持波形与 ECG 图像
临床边界仍是研究模型,不能独立诊断
中文摘要式概述

ECG-R1 面向多模态心电解读,把协议化指令生成、模态解耦和基于诊断证据的强化学习结合起来。交替模态丢弃让模型在波形或图像缺失时仍能维持一致性,证据奖励则鼓励输出与可测量心电特征相匹配的解释。项目同时公开代码、9B 权重和训练数据,复现条件较好;但大模型可能产生幻觉,评价结果不能替代前瞻性临床验证。

English summary

ECG-R1 is a multimodal reasoning model for electrocardiogram interpretation. It combines protocol-guided instruction construction, modality-decoupled learning, interleaved modality dropout, and reinforcement learning based on diagnostic evidence. The design aims to remain robust when either ECG signals or rendered images are missing and to ground explanations in measurable findings. Code, 9B-parameter weights, and instruction data are released, but hallucination risk and the absence of prospective clinical validation remain important limitations.

今日资源完整度

链接状态在生成日报时逐项核验

模型PDF代码权重数据
RETFound Plus可下载公开公开需申请
标签效率比较开放获取骨干代码骨干权重混合权限
3D OCT V-JEPA可下载公开基础权重部分公开
ECG-R1可下载公开公开公开
今日最值得复现:ECG-R1。原因不是它一定具有最高临床价值,而是论文、PDF、代码、权重和数据入口最完整,能较快完成环境验证与推理测试。若研究重点仍是“眼底+冠心病”,则优先阅读 RETFound Plus,但完整复现受纵向临床数据权限限制。