Oncoformer登顶Cell:367万人常规体检数据炼成“癌症预言家”,提前一年预判癌症、十癌种预后全覆盖

问AI · Oncoformer如何用常规数据捕捉癌症演化轨迹?

期刊:Cell(细胞,IF=64.5,全球三大顶级学术期刊之一,与Nature、Science并列,创刊于1974年,聚焦实验生物学与生物医学前沿交叉领域)| 2026年7月27日 | PMID: 42508404 | DOI: 10.1016/j.cell.2026.07.009


作者: Fei Liu(温州医科大学附属第一医院,共同第一作者)、Kai Wang(温州医科大学附属第一医院,共同第一作者)、Hui Xu、Cheng Tang、Xian Shen、Meihao Wang、Lei Yang、Li Yang、Li Liu等42位作者,通讯作者Kang Zhang(张康,温州医科大学附属第一医院/澳门科技大学),联合International Consortium of Digital Twins in Healthcare and Medicine


临床研究注册: NCT06791473

图片

一、研究背景


癌症至今仍是全球主要健康威胁,多数患者在出现症状后才被诊断,此时往往已进展至晚期。早期与晚期癌症之间生存率的巨大差距,凸显了迫切需要能够支持早期、基于风险的检测和干预策略。


现有的主动式癌症筛查手段各有短板:低剂量CT虽对肺癌有效,但存在辐射暴露和成本问题;乳腺钼靶仅覆盖单一癌种;基于ctDNA的多癌种早期检测(MCED)虽前景广阔,但成本高昂且对早期癌症敏感性参差不齐。这些方法还有一个共同的局限——它们仅提供某一时间点的静态"快照",无法捕捉癌症作为动态、纵向发展的疾病过程。


但有一个巨大的数据金矿长期被忽视:每个人在常规诊疗中留下的电子健康记录(EHR)、实验室检查结果和胸部X光影像。这些数据构成了患者多年甚至数十年的健康轨迹,理论上应该包含了恶性肿瘤的早期信号——只是这些信号太微弱、太分散,传统统计方法无力捕捉。


2026年7月27日,温州医科大学/澳门科技大学张康教授团队在Cell发表重磅研究,提出了一个大胆的解决方案:用一个统一的多模态Transformer模型——Oncoformer,从367万人的常规临床数据中学习癌症演化的全部轨迹。


图片

二、研究创新点


这项研究的创新之处可以用"一个模型、五项任务、零额外成本"来概括。


第一,数据规模史无前例。 研究团队建立了COMPASS(中国肿瘤多模态预测与监测研究)队列,涵盖367万个体、1770万次临床就诊,是同类研究中规模最大的真实世界队列。相比之下,此前最大的EHR基础模型MED-BERT的训练数据仅约2800万次就诊(来自约500万患者),但未整合影像数据且未覆盖多癌种预测任务。


第二,"一个模型打全场"的统一架构。 传统AI医学研究通常是一个模型解决一个任务——诊断模型管诊断,预后模型管预后,互不相通。Oncoformer将癌症检测、一年前预测、分期推断、治疗反应预测和无复发生存分层五项任务统一到同一框架中,共享同一患者表征。这意味着模型学到的是一个完整的"癌症演化图谱",而不是零散的任务片段。


第三,零额外成本的数据策略。 模型输入的数据——血常规、生化全套、胸部X光——都是在常规体检和门诊中已经采集的数据,不需要任何专项检查。如果该技术落地,理论上任何做过年度体检的人都可以获得个性化的癌症风险评估,而医疗系统几乎不需要增加新的开支。


第四,开创性的"治疗前预测"范式。 Oncoformer不仅能回答"这是什么癌、什么分期",还能在治疗开始前预测"这个患者对靶向药会有效吗"——用患者治疗前的全部历史数据来预测治疗后的反应轨迹,这在精准肿瘤学中是一个全新方向。

三、技术原理


Oncoformer的技术架构深度整合了近年来AI领域的多项前沿技术,其设计理念可以概括为"从时间中读懂疾病"。


多模态输入系统。 模型的输入包括两大模态:结构化EHR数据(实验室检查+生命体征)和胸部X光影像。EHR数据通过双嵌入策略处理——每个检测项目共享一个token嵌入表获取数值信息,同时拥有独立的type嵌入表标明变量身份。影像数据则通过预训练的DINOv2视觉Transformer(ViT)处理为518×518像素的张量表示。对于缺失值,模型不使用简单的均值填充或删除,而是分配专用的padding token显式标记"缺失"状态——这让模型可以区分"正常值为零"和"没有做这项检查"的差异。


时序建模:Transformer解码器+因果掩码 这是Oncoformer的核心创新。模型以患者首次就诊为时间原点,以距首次就诊的天数作为线性位置编码,输入Transformer解码器。解码器施加因果掩码(causal mask),保证任意时间点的预测只能看到此前的信息,模拟真实临床场景中的"前瞻性预测"。这相当于教会AI"如果你在2020年1月只知道这么多,你能预判什么"。


VAE增强的跨模态融合。 表格数据和影像数据各配一个变分自编码器(VAE),分别输出正态分布参数。通过对称KL散度惩罚约束两个模态的潜在分布对齐,然后将两路潜在表示取均值作为融合表征。这种设计保证模型不会过度依赖某一模态,同时让不同模态学到的表征具有可比性。


对抗性去偏置 这是确保模型可靠性的关键设计。两个对抗头分别用于消除缺失值偏倚和队列特异性偏倚——通过梯度反转层(GRL)迫使编码器学习与缺失状态和机构来源无关的表示。这意味着模型不会因为"某些医院不做某项检测"或"某些机构数据不完整"而产生系统性偏差。


两阶段训练策略。 第一阶段是自监督预训练——随机掩蔽50%的有效检测值,让模型学习从历史数据中"补全"缺失信息。预训练损失函数为四部分加权组合:掩码语言建模损失 + VAE重构损失 - 队列判别损失 - 缺失判别损失。第二阶段是针对五项具体任务的有监督微调。

图片

四、实验结果


Oncoformer在多项任务上展现了令人瞩目的性能,以下逐一拆解。


### 4.1 泛癌诊断:AUROC 0.956


在COMPASS-Replication独立验证集(86万+个体)上,Oncoformer区分当前是否患有癌症的AUROC达到0.956(95% CI: 0.955-0.958)。针对特定癌种,前列腺癌诊断AUROC高达0.977,肺癌预测AUROC达0.901。尤为关键的是校准性能:Brier分数0.041、期望校准误差0.014,远超XGBoost(0.078/0.065)和DINOv2(0.082/0.072)——对于临床决策而言,校准往往比区分度更重要。


### 4.2 提前一年预测:AUROC 0.869


这是该研究最具话题性的结果。模型在临床诊断前一年就能预测未来的癌症发生,AUROC为0.869(95% CI: 0.861-0.877),提前6个月的预测更达到0.884。各癌种中,前列腺癌预测AUROC高达0.966。研究还发现,病史时间深度是预测性能的关键驱动因素——拥有10年病史记录的患者,预测准确率显著优于仅有1年记录的患者。


更令人印象深刻的是,在完全剔除所有肿瘤标志物(如CEA、CA125、AFP等)后,仅用血常规、生化等常规检测,肺癌预测AUROC仍达0.818。这说明模型捕捉的是广泛的全身生理信号变化,而非简单地"看肿瘤标志物高不高"。


### 4.3 分期推断:平均AUROC >0.90


仅使用诊断作出之前的数据推断肿瘤临床分期(I-IV期),多数癌种的AUROC稳定超过0.90。远处转移预测尤其亮眼:结直肠癌M分期预测AUROC达0.923,前列腺癌达0.943。这意味着侵袭性肿瘤的全身"生物学足迹",在临床显现之前很久就已经存在于常规检测数据中。


### 4.4 治疗反应预测:R²最高0.721


Oncoformer能预测个体患者对特定治疗方案的反应。针对非小细胞肺癌的EGFR抑制剂治疗,肿瘤缩小轨迹的预测R²达0.658;乳腺癌内分泌治疗的预测R²达0.702;结直肠癌抗EGFR治疗(西妥昔单抗)的预测R²最高,达到0.721。前列腺癌雄激素剥夺治疗后PSA水平变化的预测R²为0.683,卵巢癌PARP抑制剂(奥拉帕利)反应预测R²为0.704。


### 4.5 预后分层:十种癌症全面超越传统方法


Oncoformer的风险评分能对10种癌症类型进行无复发生存(RFS)分层,所有p<0.01。风险比(HR)从结直肠癌的2.86到胰腺癌的1.42,一致性指数(C-index)全面优于Cox比例风险模型、随机生存森林和DeepHit。以乳腺癌为例,Oncoformer的C-index达0.809,高风险组与低风险组的生存曲线分离显著。


### 4.6 前瞻性验证:结直肠癌筛查灵敏度90%


研究在温州进行了一项前瞻性试点:从38,059名年度体检知情同意者中筛选出3,025名高风险个体,进行盲法模型预测与结肠镜对照。该筛查场景下AUROC达0.927(95% CI: 0.880-0.965),在60例癌症中识别出54例,灵敏度90.0%,特异度86.8%。


### 4.7 跨人群泛化:UK Biobank验证


在94%为白人欧洲人群的UK Biobank(50万人)上,预训练Oncoformer提取的特征相对从头训练的参考模型持续提升预测性能:肺癌未来风险预测AUROC从0.708提升至0.787,胰腺癌从0.603提升至0.690,证明了模型学到的是可泛化的基础生物学信号,而非COMPASS队列特有的统计模式。


 该图片疑似使用了AI生成技术,请谨慎甄别图片

五、技术优势


优势一:一站式全流程覆盖。 现有AI工具通常是"一个工具解决一个问题"——诊断AI、预后AI、影像AI各自独立。Oncoformer的设计哲学是"一个模型理解整个疾病过程",从风险预测到确诊、分期、治疗决策、预后评估的全流程在一个框架内完成。这种统一表征的范式避免了信息在不同模型间传递时的损耗和矛盾。


优势二:常规数据驱动,零额外成本。 不需要基因测序、不需要特殊影像、不需要液体活检。模型输入的是每个体检者都会做的血常规、生化和胸片。这决定了它的可推广性——在任何一个有基本检验能力的一级或二级医院都可以运行。


优势三:学习的是"疾病过程"而非"疾病快照"。 这是Oncoformer区别于所有传统诊断AI的根本不同。传统AI诊断模型输入一张CT或一张病理切片,输出一个判断——它看到的是一个时间点的静态图像。Oncoformer看到的是患者数百次就诊记录串联起来的健康轨迹,因此它不仅能回答"现在有病吗",还能回答"一年后会得吗"和"得了会怎样"。


优势四:严格的去偏置设计。 通过对抗性训练消除缺失值偏倚和机构特异性偏倚,使模型在不同数据质量的医疗环境中保持稳定性能。这对真实世界部署至关重要——国内外不同级别医院的检测项目和频次差异巨大。


优势五:可解释性强。 SHAP分析揭示了任务特异性的关键特征:泛癌诊断最依赖白蛋白和中性粒细胞百分比;分期推断最关键的是LDH和ALP;复发预测中CD4+ T细胞百分比和LDL胆固醇最为重要。这些发现与已知的癌症生物学高度一致——低白蛋白和高中性粒细胞比例是癌症相关炎症和营养不良的经典标志;LDH和ALP升高分别反映肿瘤负荷和骨转移。

六、应用前景


Oncoformer的应用前景可分为三个层次,由近及远逐步展开。


近期(1-3年):辅助体检中心进行风险分层。 这是最直接的落地场景。在年度体检中,Oncoformer可利用已有的实验室数据+胸片,为每位体检者生成个性化癌症风险评分。高风险个体被标记后,接受更有针对性的确诊检查(如低剂量CT、胃肠镜等),从而实现"有的放矢"的精准筛查。初步的经济学分析提示,这种策略可以大幅减少不必要的影像检查,同时提高早期癌症的检出率。


中期(3-5年):辅助肿瘤科进行个体化治疗决策。 在确诊后、治疗开始前,Oncoformer的治疗反应预测模块可以回答关键问题:这个患者对EGFR抑制剂可能有效吗?内分泌治疗和化疗哪个更合适?这种"治疗前预测"有望减少无效治疗带来的毒性反应和经济负担。与传统基因组标志物指导"该靶向什么"不同,Oncoformer回答的是"谁会响应",两者互补而非替代。


长期(5-10年):嵌入全民健康信息平台,实现全人群动态监测。 随着区域健康信息平台和全民健康档案的建设,Oncoformer有望成为数字健康基础设施的一部分。在患者授权的前提下,模型持续分析健康档案中的新数据,在风险信号跨过阈值时自动提醒基层医生和患者,将癌症管理的重心从"被动治疗"转向"主动监测"。


值得注意的是,张康团队已公开了完整代码(GitHub: github.com/kaiwang13/Oncoformer),并提供了在线演示平台。这种开放科学的态度将加速全球范围内的验证和改进。

七、研究局限性与未来方向


尽管Oncoformer展现出令人兴奋的潜力,研究团队在论文中坦率地指出了多项需要审慎对待的局限性。


第一,回顾性设计的固有局限。 绝大多数分析基于回顾性数据,治疗反应预测来自观察性数据,无法完全排除影响治疗分配的未测量混杂因素。要证明Oncoformer真正改善患者预后,需要前瞻性随机对照试验——这在论文作者看来是"临床部署前的必要步骤"。


第二,人群代表性不足。 COMPASS队列超过99%为亚洲人群,UK Biobank虽做了跨人群验证,但UKB本身存在志愿者选择偏倚(参与者平均比一般人群更健康、受教育程度更高)。在未经选择的一般风险筛查人群中的表现仍属未知。


第三,癌种间性能差异显著。 前列腺癌预测AUROC高达0.966,而胰腺癌预测仅0.690。对快速进展型癌症和罕见癌种,模型性能可能不理想。这与不同癌种的"临床前可检测窗口"差异密切相关——缓慢进展的前列腺癌窗口宽,而高度侵袭性的胰腺癌在常规检测中留下的"踪迹"少。


第四,对数据质量的依赖。 在检测实践显著不同的医疗环境中(如基层诊所vs三甲医院),模型的可靠性可能降低。研究团队虽设计了对抗性去偏置机制,但其泛化极限仍需在多中心、多层级医疗机构中系统评估。


未来方向方面, 作者提出了三条路径:一是大样本多癌种前瞻性临床试验(NCT06791473已注册);二是放射基因组学分析,以阐明模型捕捉到的"潜伏预测信号"背后的分子机制;三是实验性生物学验证,确认SHAP分析揭示的关键通路(细胞周期、TP53、DNA损伤修复等)确实介导了模型预测的癌症风险。

八、结论


Oncoformer代表了AI癌症管理的一个重要范式转折:从"一个AI解决一个任务"走向"一个模型理解整个疾病过程",从依赖昂贵专项检测走向利用已存在的常规临床数据。367万人的超大规模训练、五项任务的统一框架、一年前的癌症预测能力、跨人群的可泛化性——这些成果叠加在一起,勾勒出了一个令人期待的未来图景:癌症管理不再是被动的"等有了症状再查",而是主动的"通过数据持续守护"。


正如论文通讯作者张康教授所言,Oncoformer提供的是一个框架而非最终产品。在临床部署之前,还需要大规模前瞻性试验来回答最关键的问题——这个模型是否真的能改善患者预后、延长生存期?但从技术角度来看,这项研究已经证明了一个重要命题:每个人健康档案中的数据本身就蕴含着关于疾病的深刻信息,我们需要的只是一把能够读懂这些信息的AI钥匙。


 该图片疑似使用了AI生成技术,请谨慎甄别图片


来源:思陌智能

参考文献:

Liu F, Wang K, Xu H, et al. Advancing cancer detection and treatment using longitudinal routine clinical data. Cell. 2026;189(15):1-17. DOI: 10.1016/j.cell.2026.07.009. PMID: 42508404.


认证后即可免费领书