尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

【文献分享】CancerCellNet:评估癌症模型转录保真度的计算工具

【文献分享】CancerCellNet:评估癌症模型转录保真度的计算工具 一、文章介绍癌症研究者使用细胞系CCLs、患者来源异种移植瘤PDXs、基因工程小鼠模型GEMMs和肿瘤类器官tumoroids作为模型来研究肿瘤生物学和发现治疗方法。模型的通用性和力量源于其代表所研究肿瘤类型的保真度——然而这种保真度究竟有多高往往并不清楚。模型的丰富性和新模型易于生成的特点催生了对能够测量癌症模型与天然肿瘤在多大程度上相似或偏离的工具的需求。此前虽然有多种方法被提出来评估CCLs与肿瘤的相似性如Domcke等人的适合度评分、基于转录组或分子谱的相关性分析等但它们通常针对特定肿瘤类型且主要集中于CCLs未能覆盖PDXs、GEMMs和肿瘤类器官等更广泛的模型类别。此外这些方法也缺乏对新生成模型的快速评估能力。为填补这一空白Da Peng、Rachel Gleyzer及其合作者在Genome Medicine上发表了题为“Evaluating the transcriptional fidelity of cancer models”的研究论文提出了一个名为**CancerCellNetCCN**的基于机器学习的计算工具。CCN的核心创新在于利用“基因对gene pair”转换实现平台和物种无关的分类。具体而言CCN使用TCGA中22种实体瘤类型的8,991个患者肿瘤RNA-seq表达矩阵作为训练数据。对每种肿瘤类型CCN通过模板匹配template matching选择n个上调基因、n个下调基因和n个相对不变的基因。然后对这些基因进行“基因对转换”——比较样本中两个基因的表达量若第一个基因表达高于第二个则编码为1否则为0。这种二元转换使CCN能够兼容不同平台RNA-seq与微阵列和不同物种人类与小鼠的查询数据。CCN随后为每种肿瘤类型选择m个最具区分力的基因对作为随机森林分类器的特征并加入一个“Unknown”类别由随机打乱的基因对配置文件训练来识别不匹配任何训练类别的样本。最终分类器包含1,979个特征决策阈值设为0.25最大化Macro F1。研究者应用CCN评估了657个CCLs、415个PDXs、26个GEMMs和131个肿瘤类器官涵盖22种肿瘤类型和36种亚型。主要发现包括1PDXs在三个UCEC、PAAD、LUAD有四种模型数据的肿瘤类型中达到最高CCN分数具有最大的转录保真度潜力但中位分数低于GEMMs和肿瘤类器官2GEMMs和肿瘤类器官在四个肿瘤类型中具有最高的中位CCN分数这可能得益于免疫完整的宿主环境和3D自组织培养的生理相关刺激3食管癌ESCA没有任何模型达到转录保真度标准提示需要新的模型开发4许多CCLs未被分类为其标注的肿瘤类型可能是由于高传代数、培养条件和遗传漂变导致的转录组偏离。此外CCN还识别出如SK-OV-3标注为卵巢癌但实际更接近子宫浆液性癌和PC-3标注为前列腺癌但具有膀胱癌特征等标注错误的细胞系并通过免疫荧光实验验证了预测。二、算法原理介绍CCN的算法设计围绕“基因对转换 → 模板匹配特征选择 → 随机森林分类”三个核心步骤展开。一训练数据与基因选择。输入为TCGA 22种实体瘤的8,991个RNA-seq表达矩阵13,142个共有基因。对每种肿瘤类型ccc定义模板向量tct_ctc​该类型样本为1其余为0计算每个基因表达与tct_ctc​的Pearson相关系数。选择相关系数最大的n个基因作为上调基因n30n30n30最小的n个作为下调基因绝对值最小的n个作为相对不变基因。这共90个基因进入下一步。二基因对转换与特征选择。对选出的90个基因生成所有两两组合。基因对转换定义为对任意两个基因gi,gjg_i,g_jgi​,gj​若样本中gig_igi​表达gjg_jgj​表达则编码为1否则编码为0。这一二元转换是CCN实现平台和物种无关性的关键——它不依赖于绝对表达值仅比较相对表达次序因此可兼容RNA-seq、微阵列及跨物种数据。对每种肿瘤类型再次用模板匹配从所有基因对中选择m个与模板最相关的基因对m75m75m75每个基因在所选基因对中出现不超过3次以避免单一基因主导。所有22种类型的基因对共1,650对去重后1,979个特征合并为最终特征集。三Unknown类别与随机森林分类。将训练样本按特征集转换为二元矩阵样本×基因对。为识别不匹配任何已知类别的查询样本CCN通过随机打乱每行和每列的二元值生成70个随机配置文件标注为“Unknown”类别加入训练。用多类随机森林2,000棵树分层抽样60样本/类别训练分类器。决策阈值通过50次2/3交叉验证最大化Macro F1确定阈值0.25。查询时每个样本获得22个肿瘤类型Unknown的分数向量。分类标签规则若标注类型分数阈值且无其他类型阈值→“correct”若标注类型和其他类型均阈值→“mixed”若只有非标注类型阈值→“other”若无任何类型阈值或Unknown最高→“none”。三、总结CancerCellNet是一个基于基因对转换和随机森林的机器学习工具用于评估癌症模型相对于22种天然肿瘤类型和36种亚型的转录保真度通过二元相对表达比较实现平台和物种无关的跨模型模态比较。其核心创新在于以基因对转换消除绝对表达值的平台依赖性以Unknown类别处理不匹配样本使CCN能统一评估CCLs、PDXs、GEMMs和肿瘤类器官的转录保真度。CCN揭示了PDXs具有最高的潜在保真度但异质性大GEMMs和肿瘤类器官中位保真度更高食管癌缺乏合适模型以及多种细胞系标注错误等问题。CCN以R包和Web应用形式开源为癌症模型选择、新模型验证和模型模态比较提供了标准化、可扩展的计算框架。
返回列表