Nature | 本周最新文献速递

1. Universal cell embedding provides a foundation model for cell biology

文章标题: Universal cell embedding provides a foundation model for cell biology

中文标题: 一张细胞世界地图:UCE统一跨物种细胞表征

image

关键词: 单细胞转录组、基础模型、通用细胞嵌入、跨物种分析、零样本学习

摘要总结

单细胞RNA测序技术已经积累了来自不同组织、物种、实验平台和疾病状态的海量数据,但不同数据集在检测基因、实验批次、注释标准和物种背景方面存在明显差异,导致研究者通常需要针对每一个新数据集重新进行预处理、模型训练、参数调整和细胞注释。这不仅增加了计算成本,也使不同研究之间的细胞状态难以直接比较。文章针对这一问题提出通用细胞嵌入模型UCE,希望像语言基础模型构建通用语义空间一样,为不同来源的细胞建立统一的生物学表示空间。

UCE不把单细胞表达谱简单视为固定长度的数值向量,也不把基因机械地排列成类似自然语言的序列,而是将一个细胞抽象为由表达基因组成的RNA袋。模型依据基因表达量对表达基因进行加权采样,再利用大型蛋白质语言模型将每个基因编码为其蛋白质产物的序列表示,同时加入基因染色体位置等信息。这样,即使一个物种没有出现在训练数据中,只要能够获得蛋白质编码序列,模型理论上就可以生成相应的基因和细胞表示。

研究团队利用自监督学习训练了一个33层、约6.5亿参数的Transformer模型,并将其应用于来自数百项实验、50余种组织和8个物种的约3600万个细胞,建立Integrated Mega-scale Atlas。该图谱覆盖1000余种具有独立名称的细胞类型,使不同组织、技术平台和物种中的细胞可以投射到同一潜在空间。模型在训练过程中不依赖人工细胞类型标签,而是通过遮蔽部分表达基因并预测其是否在细胞中表达,学习细胞内部基因组合及其生物学关系。

这篇文章通过融合单细胞转录组、蛋白质语言模型和自监督Transformer,探索了能否建立无需重新训练、可跨数据集和跨物种使用的通用细胞表示空间,这对于大规模细胞图谱整合、自动细胞注释、稀有细胞识别以及跨物种生物学研究具有重要意义。更重要的是,UCE并非只完成批次校正,还表现出训练目标之外的能力:模型能够恢复胚层来源、细胞发育谱系和跨组织共享的细胞身份,并可以处理训练阶段未见过的物种。这说明大规模自监督学习可能从单细胞表达数据中提取较为稳定的生物学组织原则。

UCE因此提供了一种新的单细胞研究模式:研究者不必针对每个实验重新建立低维空间,而可以把新数据直接映射到已有通用细胞地图中,再进行近邻检索、标签迁移、细胞类型比较和假设生成。它将单细胞分析从一个数据集一个模型推进到所有细胞共享一个参考空间,为未来建立持续扩展的全球细胞知识库奠定了基础。

Fig. 1

研究方法

研究首先将每个细胞中表达量大于零的基因按照表达水平进行加权采样,并将基因对应的蛋白质序列输入ESM2蛋白质语言模型,获得具有进化与结构信息的基因嵌入。随后按照染色体及基因组位置排列基因标记,在不同染色体之间加入专用的起始和终止标记,再把基因标记序列输入33层、约6.5亿参数的Transformer。细胞的最终表示由特殊CLS标记在最后一层的输出获得。

训练采用自监督遮蔽策略,随机遮蔽约20%的表达基因,并将细胞表示与候选基因表示联合输入分类网络,预测该基因是否在当前细胞中表达。模型不使用细胞类型标签,也不要求预先选择高变基因。Fig. 1(上图)完整展示了从RNA表达、基因采样、蛋白质嵌入、染色体排序到Transformer输出细胞表示的流程。

研究团队将UCE用于约3600万个细胞,构建跨300余个数据集、50余种组织和8个物种的综合图谱。模型性能主要在未参与训练的Tabula Sapiens v.2中评估,该数据集含581,430个细胞、27种组织、167个批次和162种细胞类型。作者采用单细胞整合基准评价生物学信号保留和批次效应校正,并与Geneformer、scGPT以及需要针对数据集微调的scVI、scArches比较。研究还通过标签迁移、细胞本体距离、胚层预测、骨髓发育谱系和训练阶段未见物种测试模型的零样本泛化能力。

研究结果

与研究方法相对应,首先,自监督训练得到的UCE潜在空间能够在不使用细胞标签的情况下,将相似细胞类型聚集在一起,同时削弱实验平台、批次和数据集来源带来的技术差异。在Tabula Sapiens v.2测试中,UCE相较表现次优的Geneformer,综合得分提高13.9%,生物学信号保留得分提高16.2%,批次校正得分提高10.1%;其零样本表现还略优于需要标签和数据集微调的scVI与scArches。

其次,在同时包含10x和Smart-seq测序数据的卵巢组织中,UCE有效消除了技术平台差异,同时比对照方法更好地保持细胞类型边界。研究者仅使用Immune Cell Atlas中的UCE嵌入训练简单逻辑回归分类器,便可将其直接用于Tabula Sapiens v.2,区分记忆B细胞和初始B细胞,证明通用空间能够支持跨数据集标签迁移。

再次,3600万个细胞在统一空间中呈现与已知发育生物学相符的结构。Tabula Sapiens v.2中,97个中胚层来源细胞类型有90个最接近的细胞仍来自中胚层;内胚层和外胚层也呈现类似规律。利用UCE嵌入预测未见细胞类型的胚层来源时,准确率超过80%。嵌入距离还与Cell Ontology中的细胞类型关系显著对应。

最后,UCE能够将训练中未出现的物种映射至通用空间,并按照同源细胞功能而非单纯物种来源进行组织。跨图谱细胞类型质心的前三近邻完全匹配率达到41%,比原始表达空间提高约65%;只比较最近质心时,匹配表现提高约92%。这些结果共同支持了UCE具有跨组织、跨平台和跨物种的零样本泛化能力。

文章亮点

  1. 提出真正面向新数据的零样本细胞基础模型。 新数据不需要重新训练、微调或人工标注,明显区别于传统单细胞整合方法。

  2. 以蛋白质序列连接不同物种的基因。 不依赖预先定义的同源基因表,使模型可以处理训练阶段未出现的物种。

  3. 构建超大规模通用细胞图谱。 将3600万个细胞、1000余种细胞类型和多物种数据纳入同一潜在空间。

  4. 显示出发育谱系和胚层识别等涌现能力。 说明模型学习到的不只是批次校正规则,还包括较深层的生物学结构。

文章局限

  1. 模型规模较大,训练和大规模推理对GPU显存、计算时间及数据存储提出较高要求,可能限制普通实验室的直接应用。

  2. UCE主要依据转录组信息建立细胞表示,尚未系统整合染色质可及性、蛋白质、空间位置和谱系追踪等多模态证据。

  3. 通用空间中的距离主要代表统计和表型相似性,不能直接证明细胞之间存在发育关系或因果调控关系。

  4. 不同图谱的细胞注释粒度并不一致,某些“错误匹配”可能来自标签体系差异,而非模型本身无法识别细胞。


2. Cell-type signatures of Alzheimer’s disease shared across population groups

文章标题: Cell-type signatures of Alzheimer’s disease shared across population groups

中文标题: 跨人群追踪阿尔茨海默病的细胞共同信号

image

关键词: 阿尔茨海默病、单核转录组、染色质可及性、跨人群研究、分子亚型

摘要总结

以往阿尔茨海默病单细胞研究发现了多种疾病相关的小胶质细胞、星形胶质细胞、少突胶质细胞和神经元状态,但样本多数来自欧洲血统人群,导致这些细胞特征能否推广至其他人群长期缺乏明确答案。同时,传统聚类往往把细胞划分为离散类别,可能忽略在同一细胞类型内部连续变化的疾病程序。为解决这些问题,研究团队在非拉丁裔非洲裔美国人、拉丁裔和非拉丁裔白人中开展跨人群、跨脑区的单核多组学研究。

研究纳入167名参加长期衰老与认知研究并接受死后脑组织捐献的个体,共分析399份脑组织样本,包括背外侧前额叶皮层、颞上回和前尾状核三个区域。作者联合使用单核RNA测序和单核ATAC测序,经过样本拆分、环境RNA校正和质量控制后,获得约190万个细胞核。通过逐级聚类共识别61个主要细胞亚群,并将细胞亚群比例、连续基因表达因子与淀粉样斑块、Braak分期、tau缠结、临床认知诊断及认知下降速度等表型关联。

研究最核心的发现是,一组疾病相关细胞信号在三个人群中具有一致方向,但又表现出明显脑区特异性。例如,GPNMB阳性小胶质细胞在两个皮层区域中均与阿尔茨海默病痴呆、认知下降加快及tau病理加重相关;CD74高表达小胶质细胞主要与颞上回中的轻度认知障碍相关。SERPINH1、CD44和WIF1标记的星形胶质细胞亚群,以及SST阳性GABA能神经元和部分浅层谷氨酸能神经元,也呈现跨人群共享的疾病关联。

这篇文章通过联合单核转录组、染色质可及性、连续表达因子和跨人群Meta分析,探索了阿尔茨海默病相关细胞程序中哪些属于广泛共享信号、哪些体现脑区和患者异质性,这对于筛选更具普遍适用性的治疗靶点、建立分子分型体系和提高临床研究代表性具有重要意义。

除离散细胞亚群外,研究还使用连续因子分解发现了传统聚类未能捕获的星形胶质细胞和少突胶质细胞程序。这些程序涉及脂质处理、神经递质再摄取及细胞应激等功能,并与病理负担或认知状态显著相关。进一步以个体层面的分子程序进行聚类后,研究识别出六类认知受损者,其中轻度认知障碍和痴呆患者各形成三个分子亚群。这些亚群横跨三个人群,并不能仅由传统神经病理指标解释,提示相似的认知临床表现可能由不同细胞通路失调所导致。

该研究将共同疾病信号与分子异质性放在同一分析框架中。一方面,它表明若增加人群代表性,仍可找到跨背景稳定的小胶质细胞、星形胶质细胞和神经元信号;另一方面,它也说明并非每位患者都沿着相同分子路径发展为认知障碍。因此,未来阿尔茨海默病治疗可能既需要针对共享核心机制,也需要根据患者的分子内表型进行分层。

image

研究方法

研究对象来自ROSMAP、MARS和Latino Core等前瞻性衰老队列,包括56名非洲裔美国人、31名拉丁裔和80名白人。研究对背外侧前额叶皮层、颞上回和前尾状核开展联合snRNA-seq和snATAC-seq,其中94名个体具有三个脑区的完整样本。经过拆分、双细胞去除、环境RNA校正和质量控制,共保留约190万个细胞核,并通过多轮无监督聚类建立跨脑区统一的细胞分类体系。

作者同时分析CERAD评分、神经炎性及弥漫性斑块计数、淀粉样β负荷、Braak分期、PHFtau缠结密度、无认知损害、轻度认知障碍、阿尔茨海默病痴呆和认知下降斜率。模型校正年龄、性别、死亡后间隔,并在认知分析中加入教育程度。

为提高跨人群结果的稳健性,作者分别在三个人群中估计细胞比例与疾病表型的关系,再进行Meta分析。显著结果需满足FDR校正后P值小于0.1、三个群体效应方向一致、异质性I²低于50%,并且至少被ANCOM-BC、准二项逻辑回归、LINDA和sccomp四种组成分析方法中的两种支持。研究还使用连续表达因子分析补充离散聚类,并利用36份背外侧前额叶组织的Xenium空间原位杂交数据验证细胞比例和组织定位。

研究结果

逐级聚类共识别61个主要细胞亚群,并显示神经元具有较强脑区特异性。与组成分析方法对应,最稳定的跨人群信号是皮层GPNMB阳性小胶质细胞比例升高:该亚群与痴呆诊断、认知下降加快、较高PHFtau密度以及颞上回较晚Braak分期相关。其表达基因富集于脂质处理、细胞迁移和血管重塑。颞上回CD74高表达小胶质细胞则在轻度认知障碍者中增多,并富集线粒体相关程序。

星形胶质细胞呈现明显脑区差异。前尾状核中的SERPINH1阳性星形胶质细胞与神经炎性斑块增多相关,CD44和WIF1相关亚群也与认知或病理指标存在共享关联。神经元方面,SST阳性GABA能神经元和部分CUX2、RORB相关浅层谷氨酸能神经元在三个群体中表现出一致的疾病相关变化。

连续表达因子分析发现,少突胶质细胞和星形胶质细胞中某些疾病程序并不与单一离散亚群完全重合,却与脂质代谢、神经递质再摄取和认知下降显著相关,说明连续表示能够捕获细胞状态渐变。Xenium原位数据进一步重现了部分细胞比例与认知下降、tau病理之间的关系,并验证谷氨酸能神经元亚群处于预期皮层层次。

最后,个体分子程序聚类将认知受损者划分为六个亚群,分别包括三类轻度认知障碍和三类痴呆患者。这些分组跨越三个人群,不能由斑块或缠结程度完全解释,却均与生前认知受损有关,提示不同细胞通路异常可以汇聚到相似临床结局。

文章亮点

  1. 显著提高样本人群代表性。 同时分析非洲裔美国人、拉丁裔和白人,直接检验疾病信号能否跨人群复现。

  2. 覆盖三个皮层及皮层下脑区。 避免将单一脑区中的发现简单推广至整个大脑。

  3. 结合离散聚类与连续表达因子。 既识别具体细胞亚群,也捕捉同一细胞类型内部渐进变化的疾病程序。

  4. 发现跨人群分子亚型。 六类认知受损者提示临床相似的患者可能具有不同细胞病理机制。

文章局限

  1. snATAC-seq测序深度相对有限,中位数约为每个细胞核3万条读段,未能在多重校正后发现跨三个人群共享的单个染色质区域关联。

  2. 虽然共有399份组织样本,但每个人群的供体数仍不足100,部分亚群和人群特异效应的统计功效有限。

  3. Xenium验证样本不足40名供体,无法验证所有snRNA-seq发现。

  4. 研究基于死后组织和观察性关联,难以判断相关细胞状态是疾病驱动因素、代偿反应,还是晚期病理的结果。


3. An encyclopedia of human enhancer–gene regulatory interactions

文章标题: An encyclopedia of human enhancer–gene regulatory interactions

中文标题: 绘制增强子—基因调控百科全书

image

关键词: 增强子、靶基因、ENCODE、CRISPR扰动、非编码变异

摘要总结

人类复杂疾病相关遗传变异大多位于非编码区,但确定一个非编码变异影响哪个增强子、该增强子进一步调控哪个基因,始终是功能基因组学的重要难题。传统方法常使用基因组距离、染色质开放程度或三维接触推断增强子—启动子关系,但物理接触并不等同于真实调控,距离最近的基因也不一定是功能靶基因。不同预测模型还经常使用不同评价数据,导致其准确性难以公平比较。

这项研究整合ENCODE计划产生的染色质状态、DNase-seq、Hi-C、ChIA-PET和大规模CRISPR扰动数据,建立了增强子—基因预测模型ENCODE-rE2G及统一基准测试框架。作者首先整理10,356个经过CRISPR实验测试的元件—基因对、3万余个精细定位eQTL以及569个已连接至较可信因果基因的精细定位GWAS变异,并强调以遗传或实验扰动所反映的“调控关系”为金标准,而不是简单以染色质物理接触作为真值。

ENCODE-rE2G采用监督式逻辑回归,输入包括增强子和启动子的DNase信号、平均三维接触频率、activity-by-contact指标、增强子与启动子距离、启动子类别以及邻近增强子状态等。经过最佳特征子集筛选,通用模型保留12个候选变量中的8个;扩展模型则整合45项表观基因组和既有模型特征。该设计兼顾预测性能与可解释性,并使通用版本仅凭细胞类型特异的DNase-seq和参考Hi-C图谱即可应用到大量新样本。

这篇文章通过整合CRISPR功能筛选、表观基因组、三维基因组和遗传变异精细定位,探索了如何在全基因组尺度准确连接增强子与靶基因,这对于解释非编码疾病变异、识别关键调控元件和筛选疾病相关细胞类型具有重要意义。

作者随后将模型应用于1,458个ENCODE生物样本,覆盖369种细胞类型和组织,获得92,176,227条增强子—基因调控关系,形成目前规模最大的同类资源之一。每个样本平均包含约40,210个独特调控元件和63,221条调控关系,覆盖约0.89%的人类基因组。该资源支持从基因反查可能增强子、从增强子查询靶基因,以及为非编码GWAS变异预测作用细胞类型和效应基因。

研究还从模型解释中提出新的调控认识。增强子活性和三维接触仍是核心信息,但启动子类别会影响基因对远端增强子的依赖程度;相邻增强子之间也可能形成协同环境,使单个相对较弱的元件具有可检测的调控效应。这表明增强子—启动子通信并非简单由“一段增强子加一次接触”决定,而是受到启动子属性及局部调控网络共同塑造。

image

研究方法

研究首先构建统一金标准,将K562等细胞中的大规模CRISPRi增强子扰动结果重新分析并标准化,形成10,356个实验测试的元件—基因对;同时整合3万余个精细定位eQTL,以及GWAS中能够通过独立编码变异推断因果基因的非编码位点。作者分别在CRISPR、eQTL和GWAS任务中评价不同模型,以检验其能否跨实验类型和细胞背景泛化。

ENCODE-rE2G使用逻辑回归预测元件是否调控目标基因。通用模型输入DNase-seq元件活性、启动子活性、65个ENCODE Hi-C数据集平均所得的三维接触、ABC分数、元件至启动子距离、管家基因启动子类别,以及目标元件附近5 kb范围内其他增强子的活性。通过最佳子集分析从12项候选特征中筛选8项,以获得具有校准概率的简洁模型。

ENCODE-rE2G Extended进一步加入组蛋白ChIP-seq、细胞特异Hi-C、ChIA-PET以及EpiMap、GraphReg等模型信息,共使用45项特征。模型完成基准测试后,作者将可广泛部署的版本用于1,458个DNase-seq生物样本,以CRISPR基准中70%召回率所对应的阈值筛选增强子—基因关系,并分析距离分布、增强子数量、启动子类别、变异富集和疾病细胞类型。

研究结果

与统一基准测试相对应,ENCODE-rE2G在CRISPR、eQTL和GWAS三类任务中均达到或接近最佳表现,说明直接使用功能扰动训练模型,比单纯依赖距离或染色质接触更能预测真实调控关系。在29,245个来自94项UK Biobank性状的精细定位远端非编码变异中,K562和GM12878预测增强子对相应血液学或免疫性状变异的富集达到10.6倍,高于对照ABC模型的9.6倍。

在11项血液相关性状及473个血液生物样本中,ENCODE-rE2G连接非编码可信变异与靶基因的精确率达到68%,与对照模型的67%接近,但召回率由41%提高至51%,表明模型在保持低错误率的同时找回了更多真实靶基因。

模型在1,458个样本中最终预测92,176,227条调控关系。距离分析显示,24.1%的关系位于10 kb以内,74.6%位于100 kb以内,但仍存在较远距离作用,说明“最近基因”原则只能解释部分关系。另有18.5%的预测增强子DNase信号低于全局中位数,提示靠近启动子或位于协同增强子环境中的弱元件也可能产生功能。

模型解释结果显示,增强子活性、三维接触和距离是主要预测因素,同时启动子类别及邻近增强子活性能够提供额外信息。部分基因由少数强增强子控制,另一些基因则连接多个弱至中等强度元件,揭示不同基因的调控复杂度并不相同。

文章亮点

  1. 建立统一、功能导向的评测体系。 以CRISPR、eQTL和GWAS扰动证据评价模型,而非把物理接触误认为调控真值。

  2. 资源规模巨大。 覆盖1,458个样本、369种细胞和组织以及超过9200万条调控关系。

  3. 模型兼具性能、可扩展性和可解释性。 通用版本只需DNase-seq与参考Hi-C即可应用于大量新细胞类型。

  4. 揭示启动子类别和增强子协同的重要性。 将调控机制从单个增强子—启动子对扩展到局部调控网络。

文章局限

  1. 主要监督训练数据来自K562等少数可进行大规模CRISPR筛选的细胞,其他细胞类型中的调控规则可能存在差异。

  2. 9200余万条关系主要是模型预测,并非每一条都经过实验验证,使用者仍需结合具体疾病和细胞背景开展功能实验。

  3. 通用模型使用跨组织平均Hi-C图谱,虽然提高了可部署性,但可能忽略某些细胞类型特异的三维染色质结构。

  4. 阈值采用CRISPR基准中70%召回率设定,资源规模、召回率和假阳性率之间仍存在不可避免的权衡。


4. A Bayesian framework for longitudinal EHR and genetic discovery

文章标题: A Bayesian framework for longitudinal EHR and genetic discovery

中文标题: 让病历动起来:解码终身疾病轨迹

image

关键词: 电子健康记录、贝叶斯模型、疾病轨迹、多基因风险、精准医学

摘要总结

电子健康记录保存了患者在数十年中陆续出现的诊断,但传统研究通常一次只分析一种疾病,或将共病简化为静态相关网络。这种处理难以反映疾病风险如何随年龄变化,也不能识别同一诊断背后可能存在的不同生物学亚型。与此同时,大规模生物样本库已经将EHR与遗传数据连接起来,但多数临床轨迹模型没有在统一框架中直接引入多基因风险和罕见变异信息。

文章提出贝叶斯生成模型ALADYNOULLI,用于联合分析年龄、纵向诊断、个体遗传背景和多种疾病之间的共现关系。模型不把患者简单归入单一疾病簇,而是假设每位患者在每个年龄都具有多个潜在疾病特征的动态载荷;每个疾病特征则包含一组随年龄变化的疾病概率。例如,一位患者可以同时具有心血管、代谢和炎症特征,只是这些特征在不同年龄阶段所占权重不同。

模型的一个关键设计是使用概率的混合,而不是先混合潜在变量再计算疾病概率,因此能够更合理地描述慢性病和同一时间发生的多种诊断。个体—特征载荷和疾病—特征关系均使用高斯过程描述,使风险随年龄平滑变化。模型还将36项多基因风险评分、性别和10个遗传主成分纳入个体载荷的均值结构,从而把遗传易感性与纵向共病轨迹直接联系起来。

研究在UK Biobank、Mass General Brigham和All of Us三个独立队列中进行验证,总样本超过68.3万人,最长随访52年,覆盖348种疾病。模型在不同队列中恢复出21个可重复的疾病特征,中位组成保留率达到80%。这些特征对应心血管、代谢、炎症、胃肠、肺部、精神神经和肿瘤等临床体系,同时能够在同一种诊断内部识别风险轨迹和遗传背景不同的患者亚型。

这篇文章通过贝叶斯生成模型联合纵向EHR、年龄和遗传风险,探索了多种疾病如何在个体一生中共同演化,这对于疾病早期预测、复杂共病研究、患者分层和新的遗传位点发现具有重要意义。与黑箱预测模型不同,ALADYNOULLI不仅输出某种疾病的未来风险,还提供患者在不同潜在疾病特征上的动态载荷,因此可以解释风险来自何种共病和遗传结构。

研究进一步将潜在疾病特征作为新表型开展GWAS,共发现151个全基因组显著位点,其中包括单一疾病GWAS未能发现的心血管相关信号。家族性高胆固醇血症携带者富集于心血管特征,克隆性造血携带者富集于炎症特征;LDLR、TTN和BRCA2的罕见变异负担也与相应疾病特征一致。模型在1年和10年预测中优于PCE、PREVENT和Gail等专病风险评分,说明只利用常规诊断历史和遗传信息,也可以提取具有临床价值的动态风险。

image

研究方法

ALADYNOULLI为每位个体、每种疾病和每个年龄定义条件发病风险。该风险由多个潜在疾病特征的概率加权组合构成,其中θ表示个体在某一年龄对各特征的归一化载荷,φ表示各特征在不同年龄与具体疾病之间的关系,κ用于全局概率校准。个体载荷通过softmax转换,保证各特征权重可比较。

θ背后的潜在变量采用高斯过程先验,使个体疾病特征随年龄平滑变化。其均值同时包含特征基线以及遗传和人口学变量,包括36项PRS、性别和10个遗传主成分。疾病—特征关系φ同样采用高斯过程,使同一疾病在不同年龄可以由不同潜在特征主导。上图展示了诊断时间轴、群体疾病特征、个体动态载荷和疾病预测概率之间的关系。

模型在三个独立生物样本库中训练和复制,分析348种PheCode疾病。作者通过队列间特征匹配评价可重复性,以已知家族性高胆固醇血症、克隆性造血、1型与2型糖尿病及罕见基因变异验证生物学合理性。随后以疾病特征载荷开展GWAS,并通过逆概率加权校正队列招募和医疗选择偏倚。预测评价包括动态1年风险、招募时1年和10年风险,并与Cox模型、PCE、PREVENT、Gail及Delphi-2M比较。

研究结果

模型在超过68.3万名参与者中识别出21个跨队列可复制的疾病特征,特征组成的中位保留率为80%。这些特征能够重建心血管、代谢、肺部、炎症和肿瘤等临床上可解释的共病体系,并显示同一患者的主导特征会随年龄和新增诊断动态变化。

在患者分层方面,即使患者具有相同疾病诊断,其潜在特征载荷也可形成明显不同的亚群,部分比较的Cohen’s d达到4.25,95%的亚型比较达到P≤1×10⁻⁸。例如,家族性高胆固醇血症患者具有更高的心血管特征载荷,克隆性造血患者更偏向炎症特征,表明模型识别的亚型具有真实遗传和病理基础。

以特征载荷作为表型开展GWAS后发现151个显著位点。心血管特征中包括IL6R、SCARB1、SMAD3和PDGFD等相关信号,其中部分位点未在研究内部的单一心血管疾病GWAS中成为领先位点,显示多疾病共享特征能够聚合分散效应,提高遗传发现能力。

风险预测方面,ALADYNOULLI在心血管疾病和乳腺癌等疾病的1年及10年预测中优于PCE、PREVENT和Gail。逆概率加权分析表明,在调整样本选择差异后,疾病特征的核心生物学结构仍可保留。其疾病级预测与Delphi-2M等代码级序列模型具有互补性:后者侧重下一个医疗代码,ALADYNOULLI则侧重可解释的疾病风险与长期轨迹。

文章亮点

  1. 同时建模多疾病、年龄和遗传背景。 超越单病种分析和静态共病网络。

  2. 将人群疾病特征与个体动态载荷分离。 既可发现群体规律,也可生成个体化终身风险曲线。

  3. 兼顾预测与遗传发现。 潜在特征不仅改善风险预测,还发现单病种GWAS遗漏的位点。

  4. 具有明确似然函数。 可通过逆概率加权处理选择偏倚,比难以校正的黑箱模型更具统计优势。

文章局限

  1. EHR受到医疗可及性、编码习惯和病史遗漏影响,首次记录的诊断时间不一定等于真实发病时间。

  2. 模型纳入遗传因素,但没有显式建模环境暴露、饮食、运动和社会经济因素。

  3. 使用既有PRS可能遗漏主要作用于共病特征、但对单一疾病效应较弱的遗传信号。

  4. 模型假设遗传效应近似线性、多个特征对疾病风险近似可加,可能无法覆盖复杂非线性和交互作用。

  5. 时间轴使用年龄而非日历年份,不能充分描述诊断标准、治疗水平和疾病流行率随年代变化的队列效应。

  6. 21个疾病特征虽然具有统计和临床一致性,但其具体分子机制仍需实验和前瞻性研究验证。


We thank the blogger (orange_milk_sugar, Wenyan Chen) for sharing and communicating these latest advances in life science research.

感谢小可爱们多年来的陪伴, 我与你们一起成长~

wechat

posted @ 2026-07-22 17:18  橙子牛奶糖  阅读(1)  评论(0)    收藏  举报