当前位置:首页>排行榜>系统评测20种多组学生物标志物挖掘计算方法

系统评测20种多组学生物标志物挖掘计算方法

  • 更新时间 2026-09-19 17:32:49
系统评测20种多组学生物标志物挖掘计算方法

摘要

多组学谱可表征癌症生物学特征,为预后评估与治疗方案选择提供生物标志物挖掘支撑。虽已提出多种多组学生物标志物识别计算方法,但其挖掘临床相关标志物的能力尚未经系统评估,所得候选标志物用于下游验证的可靠性尚不明确。本研究基于5个真实数据集,采用整理后的预后与治疗金标准生物标志物,系统基准评估20种代表性统计、机器学习与深度学习方法,从标志物识别准确性和稳定性双维度评测性能。结果显示,DeePathNet与DeepKEGG综合性能最优;有效标志物挖掘依赖生物知识融合、全局特征交互、多变量特征归因与有效正则化。组学类型贡献分析揭示了方法与模态特异性偏差,凸显多组学整合的重要性。本研究还在模拟数据集上评测方法的信号-噪声敏感性,整合最优方法结果构建共识生物标志物组合,为后续研究提供候选靶点。最后提供易用界面,支持新方法与20种基线方法的基准测试,或在自定义多组学数据集上开展标志物识别。

https://github.com/athanzli/CancerMOBI-Bench

ruishanl@usc.edu

#多组学整合 #生物标志物挖掘 #基准评估 #机器学习 #深度学习

结果

基准设计与评估框架

表1基准测试的癌症多组学生物标志物识别计算方法概览

表2  使用的真实数据集统计信息

1基准评估流程概述

(a) 从3大肿瘤学知识库收集生物标志物,保留经AMP/ASCO/CAP指南判定为I级临床证据的标志物;

(b) 真实数据包含30个多组学子数据集,涵盖5项任务与6种组学组合,预后/治疗任务的肿瘤类型、药物与可用标志物匹配并经过滤规则筛选;真实数据作为统计参考,用于InterSIM生成模拟多组学数据;

(c) 基准测试12种深度学习方法(前馈神经网络、自编码器、图网络、Transformer架构)与8种统计机器学习方法;

(d) 基于排序的性能量化指标,采用6项准确性指标+3项稳定性指标。

真实数据的准确性

表3  30次实验中各方法将金标准生物标志物排入前10/50/100位的次数

2真实数据整体性能

(a) 所有任务与指标的准确性,柱高为单方法、单任务在6种组学组合下交叉验证均值的平均指标值;

(b) 曼-惠特尼U检验P值(负对数转换),每个数据点对应单次实验,垂直虚线为P=0.05;

(c) 所有任务与指标的稳定性,柱高为单方法、单任务在6种组学组合下的平均指标值。

NDCG:归一化折损累积增益;-表示因方法先验知识基因集无标志物导致数据不可用。

组学类型对生物标志物识别的贡献

3 生物标志物识别中的组学类型贡献

(a) 饼图展示驱动标志物识别的组学类型,每饼分30部分对应5折交叉验证×6种组学组合的单次实验;标志物排入前1%时按主导组学着色,否则为灰色;

(b) 不同排名百分位的组学类型占比,每个任务含6列对应6种组学组合,按1,000个排名截止值计算占比,排名基于基因水平转换前的原始特征分数

模拟数据的性能

4模拟数据性能

克利夫兰点图展示生物标志物识别准确性(a)(柱为5折交叉验证标准差)与稳定性(b),颜色代表生物标志物信号强度。

共识多组学生物标志物组合

表4  按任务与组学类型划分的共识多组学生物标志物组合(剔除金标准生物标志物)

方法选择实用指南

5方法选择实用指南

基于样本标签可用性、GPU可及性、是否保留原始特征空间的方法选择决策树;按基准性能将方法分为推荐、可用、不推荐3级;提供3种数据规模下的运行时间与峰值内存参考,深度学习方法标注GPU峰值内存,非深度学习方法标注CPU峰值内存。

关键点

❶ 基于临床验证的I级生物标志物,在5个真实癌症数据集上,系统基准评估了20种用于多组学生物标志物识别的统计、机器学习与深度学习方法。

❷ 方法学分析表明,有效的生物标志物挖掘依赖生物知识整合、全局特征交互、多变量特征归因以及正则化

❸ 模拟数据与真实数据结果间的差异,凸显了模拟数据的局限性,也印证了在真实癌症队列上开展基准评估对保障临床转化价值的必要性。

❹ 组学类型贡献分析揭示了方法与模态特异性偏差,表明生物标志物识别受分子层选择的显著影响,更全面的多组学整合能提升捕获有效生物学信号的概率。

❺ 通过鲁棒秩聚合(RRA)整合最优方法的排序结果,构建的共识生物标志物组合可降低方法特异性偏差,为后续生物学与临床研究提供高可信度候选靶点。

❻ 提供易用的评估流程,支持研究人员在整理后的任务数据集上,将新方法与20种基线方法进行基准对比,也可在自定义多组学数据上应用选定方法开展生物标志物识别

数据

基准测试数据集与结果

10.5281/zenodo.17860662

基因组数据共享平台(GDC)癌症基因组图谱(TCGA)多组学与临床

https://portal.gdc.cancer.gov

参考生物标志物

❶ OncoKB

https://www.oncokb.org/actionable-genes

❷ CIViC

https://civicdb.org/releases/main

❸ 癌症基因组解释器(CGI)

https://www.cancergenomeinterpreter.org/data/biomarkers

人类基因命名委员会(HGNC)完整基因集信息

https://storage.googleapis.com/public-download-files/hgnc/tsv/tsv/hgnc_complete_set.txt

miRTarBase数据库miRNA靶基因信息检索

https://mirtarbase.cuhk.edu.cn/~miRTarBase/

https://gdc.cancer.gov/about-data/gdc-data-processing/gdc-reference-files

❶ 甲基化芯片注释文件

HM450.hg38.manifest.gencode.v36.tsv.gz

❷ TCGA抗体说明文件

TCGA_antibodies_descriptions.gencode.v36.tsv

STRING数据库蛋白质互作(PPI)网络拓扑文件

https://string-db.org/

详细总结

思维导图

评测方法(共20种)

参考

Brief Bioinform. 2026 May 4;27(3):bbag200. doi: 10.1093/bib/bbag200.

Benchmarking computational methods for multi-omics biomarker discovery in cancer

260506CancerMOBI-Bench.pdf

注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。

End      

随机文章