尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

【文献分享】KCFtools:基于k-mer的无比对基因组变异检测与基因型矩阵构建工具

【文献分享】KCFtools:基于k-mer的无比对基因组变异检测与基因型矩阵构建工具 一、文章介绍理解和利用遗传多样性对进化生物学和现代作物改良都至关重要。渐渗introgression——通过杂交和回交在不同物种或群体之间转移单倍型——在驯化和适应过程中扮演了关键角色引入了如胁迫耐受性和病害抗性等有益性状。随着染色体级别参考基因组的发展我们解析大型复杂基因组如小麦、燕麦的能力显著提升大规模群体重测序和泛基因组框架的建立也揭示了与农艺性状相关的结构变异和存在/缺失变异PAV。然而全面利用这些遗传资源来鉴定渐渗和可变区域需要能够处理大规模、复杂和多样化基因组数据集的计算方法。传统渐渗检测方法通常依赖于基于SNV的连锁不平衡模式、系统发育推断、D统计量和IBDidentical by descent等。尽管近年来发展了基于单倍型的统计量或基于模型似然的推断方法提供了更高的灵敏度或特异性但这些方法常常受限于计算成本高、在复杂或多倍体基因组中功效降低以及难以自信地区分渐渗与相似信号如不完全谱系分选。这些局限性促使了对更灵活、稳健、高分辨率工具的需求以超越传统基于比对的基因组变异分析。与此同时基于k-mer的方法在基因组分析中已展现出巨大潜力——从基因组大小估计到结构变异检测——但一直缺乏专门利用k-mer方法进行全基因组渐渗鉴定的专用工具。k-mer GWAS方法虽能检测参考基因组中缺失或被传统变异检测流程遗漏的序列但庞大的特征数量使其计算成本高昂限制了可扩展性和可解释性。为填补这一方法空白Sivasubramani Selvanayagam、Jesus Quiroz-Chavez及其合作者在Bioinformatics上发表了题为“KCFtools: a k-mer-based toolkit for introgression and variable region detection from genomes and transcriptomes”的研究论文提出了一个名为KCFtools的基于k-mer的综合性工具包。KCFtools的核心方法是用非重叠基因组窗口或转录本窗口分割参考基因组然后通过KMC3高效计算查询序列测序读段或组装基因组中k-mer的存在/缺失情况计算每个窗口的身份得分IS。身份得分综合了三个因素观察到的k-mer比例Ko/KtK_o/K_tKo​/Kt​、窗口内k-mer之间的内部间隙DiD_iDi​和窗口两端的尾部间隙DtD_tDt​ISWo⋅(Ko/Kt)Wi⋅(1−Di/L)Wt⋅(1−Dt/L)IS W_o \cdot (K_o/K_t) W_i \cdot (1-D_i/L) W_t \cdot (1-D_t/L)ISWo​⋅(Ko​/Kt​)Wi​⋅(1−Di​/L)Wt​⋅(1−Dt​/L)。这种设计不仅评估k-mer密度还考虑间隙分布从而更全面地反映序列相似性。依据参考基因组与查询基因组的选择方式可将基因组区域分类为渐渗区域或可变区域若以供体基因组为参考连续窗口身份得分高于阈值则判定为渐渗区域供体基因组片段存在于查询中若以受体基因组为参考得分低于阈值则判定为可变区域基因组分歧区域。KCFtools进一步支持将多样本的k-mer变异矩阵转换为基因型矩阵——每个窗口编码为0纯合参考、2纯合替代或1杂合捕获窗口内多重单倍型信号可直接用于群体遗传学分析和GWAS。研究者通过模拟Oryza glaberrima与Oryza sativa之间的渐渗验证了方法准确性F-score0.99并评估了测序深度对结果的影响8×覆盖度时k-mer比例趋于稳定。将KCFtools应用于198份莴苣Lactuca sativa重测序数据成功鉴定出从野生L. virosa渐渗到栽培莴苣的约25 Mb大片段并使用基于k-mer的基因型矩阵进行GWAS检测到与霜霉病Bremia lactucae抗性相关的已知和新的关联位点验证了其应用潜力。二、算法原理介绍KCFtools的算法设计围绕“k-mer计数与窗口划分 → 身份得分计算 → 渐渗/可变区域分类 → 基因型矩阵生成”四个核心步骤展开。一k-mer计数与窗口划分。输入为参考基因组fasta和查询序列组装基因组或测序读段。查询序列经KMC3生成k-mer签名哈希表支持k31-81。参考基因组按非重叠窗口分割默认5-50 kb可调也支持基于GTF注释的基因/转录本窗口用于RNA-seq。每个窗口计算两个关键量总k-mer数KtK_tKt​参考窗口中的k-mer总数和观察到的k-mer数KoK_oKo​查询签名表中匹配的k-mer数。二身份得分IS计算。单纯依靠Ko/KtK_o/K_tKo​/Kt​会忽略k-mer缺失的分布模式——相同比例下间隙集中在两端可能只是窗口边界效应与分散在内部可能代表真实序列差异有不同生物学含义。KCFtools引入间隙分量将窗口内未被观察k-mer覆盖的碱基k-mer距离分为内部距离DiD_iDi​被观察k-mer包围的间隙总长和尾部距离DtD_tDt​窗口两端的间隙总长。身份得分为ISWo⋅(Ko/Kt)Wi⋅(1−Di/L)Wt⋅(1−Dt/L)IS W_o \cdot (K_o/K_t) W_i \cdot (1-D_i/L) W_t \cdot (1-D_t/L)ISWo​⋅(Ko​/Kt​)Wi​⋅(1−Di​/L)Wt​⋅(1−Dt​/L)其中LLL为窗口有效长度Wo,Wi,WtW_o,W_i,W_tWo​,Wi​,Wt​为可调权重默认Wo0.5W_o0.5Wo​0.5Wi0.25W_i0.25Wi​0.25Wt0.25W_t0.25Wt​0.25。权重可依数据特性调整——对于保守基因组可给Ko/KtK_o/K_tKo​/Kt​更高权重对于高变区域可增加间隙权重。三渐渗/可变区域分类。身份得分阈值通过窗口得分分布或已知阳性对照确定。当查询为渐渗个体、参考为供体基因组时连续窗口IS≥IS \geIS≥阈值判定为渐渗区域供体片段存在。当查询为群体样本、参考为受体基因组时ISIS IS阈值判定为可变区域与参考分歧。后处理用IBSproportion过滤短假阳性——定义为区域中IBS窗口块占总窗口的比例短块如测序噪音导致可被滤除。四基因型矩阵生成。多样本k-mer变异数据经cohort插件合并为KCF文件再通过kcf2gt插件转换为类基因型矩阵。对每个窗口识别最普遍的信号作为主要等位基因编码0第二普遍信号作为替代等位基因编码2其余所有单倍型信号归为杂合编码1——这里的“杂合”实际代表窗口内多重单倍型多样性而非SNV水平的真实杂合性。该矩阵可直接用于GAPIT等GWAS软件进行关联分析。三、总结KCFtools是一个基于k-mer的无比对工具包通过将参考基因组划分为非重叠窗口并计算查询序列中k-mer的观察比例和间隙分布快速鉴定渐渗区域和可变区域同时支持将多样本k-mer变异矩阵转换为基因型矩阵用于GWAS和群体遗传学分析。其核心创新在于以身份得分综合评估窗口内k-mer密度与间隙分布摆脱了传统SNV检测对读段比对和变异调用的依赖在大型复杂基因组如莴苣中具有显著的计算效率优势比BWA-DeepVariant快数十倍。在莴苣群体中成功鉴定了来自野生L. virosa的约25 Mb渐渗片段并检测到与霜霉病抗性相关的已知和新的关联位点为作物育种中的渐渗鉴定和功能基因挖掘提供了灵活、快速且可扩展的计算解决方案。
返回列表