
摘要大规模宏基因组研究日益需要具备高灵敏度、高精度、菌株分辨能力且计算可行的分类学分析谱。现有分析谱工具通常在分类学广度、灵敏度、精度与速度之间相互权衡限制了其在高分辨率微生物组分析中的应用。本研究提出protalprofiling through alignment通过比对进行分析谱——一种基于比对的超快速方法用于对宏基因组进行物种水平与菌株水平分辨的分析谱。protal 结合了新开发的比对算法、基于机器学习的分类器以及保守的细菌标记基因对标准化且定期更新的GTDBGenome Taxonomy Database分类体系中收录的物种进行分析谱。protal 可靠地对 GTDB r226 中的全部143,614 个细菌与古菌物种进行谱分析并在 CAMI2 基准测试中取得了高于所有受测当代分析谱工具的精度包括 MetaPhlAn 4、mOTUs4、sylph 与 Kraken2Bracken物种水平平均精度98.3%而次优工具 sylph 为 97.5%。在定制化基准测试中protal 在仅由单个参考基因组代表的稀有物种以及包含 10,000 个物种的高度复杂群落中表现出尤为显著的提升F1 值分别比次优工具高 9% 和 14%。由于 protal 保留了读段比对信息其能够以可与 StrainPhlAn 4 相媲美的准确度重建被检测细菌之间的种内系统发育关系。与专用的菌株分析谱流程不同protal 在物种水平分析谱的同时进行菌株分析从而无需额外步骤即可实现最高40 倍加速。上述特性使得在普通商用硬件上对成千上万份宏基因组进行菌株分辨分析谱成为可能。软件、数据库与教程可在 https://github.com/4less/protal 与 http://protal.earlham.ac.uk 获取。Keywords: 分类学分析谱菌株分辨分析高通量鸟枪法宏基因组学文献信息Fritscher, J., Duncan, A., Hildebrand, F. (2026). Protal: profiling through alignment — a strain-resolved analysis.bioRxiv. Posted August 6, 2026. doi: https://doi.org/10.64898/2026.08.03.742433载体bioRxiv 预印本未经同行评审作者单位Quadram Institute Bioscience 食品、微生物与健康组Earlham Institute东英吉利大学通讯作者Falk Hildebrandfalk.hildebrandquadram.ac.uk期刊与影响因子本文为 bioRxiv 预印本尚未检索到正式发表期刊及对应 IF 信息软件与数据库https://github.com/4less/protalhttp://protal.earlham.ac.uk研究总结Protal菌株分辨分析谱研究背景大规模宏基因组需要高速高精度现有工具在广度速度精度间权衡菌株分析需独立下游流程核心方法GTDB r226通用标记基因core-mer与flex-mer比对随机森林物种判定参考引导多序列比对关键结果覆盖143614个物种CAMI2精度98.3%稀有物种F1提升9%万物种群落F1提升14%菌株分析最高40倍加速科学意义物种与菌株分析同步完成普通硬件可扩展至千级样本背景介绍近年来宏基因组组装与基因组分箱技术的快速发展以及公开测序数据的迅速积累极大扩展了以 GTDB 为代表的参考基因组数据库的分类多样性。组装驱动的方法虽可提供高分辨率的微生物群落特征但在大规模分析中计算代价高昂且难以恢复低丰度分类群。相比之下基于参考的分类学分析谱提供了一种互补思路它充分利用来自分离基因组与宏基因组组装基因组的扩展参考数据库具有更高的计算效率以及对低丰度分类群更高的灵敏度因此特别适用于人类肠道等已被充分表征的微生物组、含有大量低丰度分类群的复杂微生物群落以及大规模数据集。当前的基于参考的分析谱工具通常依赖系统发育信息标记基因如 MetaPhlAn 4、mOTUs4或依赖基因组特异性 k-mer 的累计计数作为物种存在证据如 Kraken2、sylph。尽管菌株水平变异的生物学重要性日益得到认可多数分类学分析谱工具仍主要优化于物种水平的推断。菌株水平分析通常需要独立的下游流程——如 MetaPhlAn 4 的 StrainPhlAn 4、mOTUs4 的 metaSNV——这增加了计算复杂性并限制了可扩展性。为应对学界对于快速、高分辨且精确的宏基因组分析谱工具的需求作者推出了 protal。该工具引入了一个具有系统发育意识的、利用独特 GTDB 标记基因来联合推断分类组成与菌株关系的比对框架其核心是一种新开发的比对算法比当代比对器更精确也更快速。protal 的关键特征包括完全兼容 GTDB 数据库及其更新对仅有一个可用参考基因组的物种也能稳健表征进化准确的菌株水平系统发育比同类工具快一到两个数量级的分析谱速度。重要结果结果1protal 实现、数据库覆盖度与比对性能protal 以 C 编写实现能够在集成、开源的框架内对宏基因组数据进行快速且内存高效的处理。使用 GTDB r226 时protal 参考数据库代表了143,614 个物种图 1a,b。protal 使用通用的单拷贝基因作为参考这些基因既支持准确的物种检测与丰度估计也为菌株分辨分析提供保守的进化信号。基于 GTDB r226 构建时protal、Kraken2 与 sylph 覆盖 143,614 个物种29,405 个属与 5,932 个科而 MetaPhlAn 4 与 mOTUs4 所代表的物种数仅为前者的一半或更少图 1b。这一差异至关重要因为 GTDB r226 中65.5% 的物种仅由单个基因组代表而 protal 使用通用的单拷贝标记基因能够仅凭单个基因组对一个物种进行谱分析无需逐物种地发现标记。protal 使用一种基于精确 k-mer 匹配、采用 core-mer 与 flex-mer 的自定义比对算法二者借助 syncmers 在内存中被压缩。候选标记基因随后由波前比对进行评估。在模拟读段的比对基准测试中protal 在 MAPQ 5 时达到77.4% 的真阳性率与 3.0% 的假发现率在 2×5 GB 输入读段的比对中耗时 5 分 52 秒比 BWA-MEM2 快 2 倍以上比 Bowtie2 快 3 倍以上比 minimap2 快 4 倍以上图 1d,e。Figure 1 图注protal 工作流程、数据库覆盖度、比对策略与比对性能概览。(a) protal 分析谱与菌株分辨流程示意图(b) 各分析谱工具基于 GTDB r226 的物种覆盖度对比© core-mer 与 flex-mer 比对策略示意(d) 不同比对器的真阳性率与假发现率(e) 比对运行时间与内存占用对比。结果2protal 在物种水平分析中达到最高精度作者在 9 个合成宏基因组基准数据集上对 protal 进行了评估包括来自 5 个人体部位气道、胃肠、口腔、皮肤、泌尿生殖的 CAMI 数据集n49、小鼠肠道n49与海洋n9群落以及一个稀有物种基准R.Sp.n20和一个包含约 10,000 个物种的高复杂度宏基因组n20图 2a。protal 在所有数据集上均取得了最高的物种水平平均 F1 值0.969±0.021、灵敏度0.956±0.031与精度0.983±0.026图 2a。sylph 是整体上最强的替代方案F10.939±0.050。protal 的优势在更具挑战性的模拟中最为明显。在稀有物种基准中protal 达到最高 F1 值0.949±0.012与灵敏度0.919优于 sylphF10.863±0.019、MetaPhlAn 4F10.495±0.025与 mOTUs4F10.619±0.029。在高复杂度宏基因组中protal 保持了高灵敏度0.963±0.002与精度0.998±0.000F1 值达 0.980±0.001而 sylph 为 0.843Kraken2Bracken 为 0.712MetaPhlAn 4 为 0.382mOTUs4 为 0.414。protal 的预测物种丰度与期望丰度高度吻合物种水平 Pearson 相关系数均值达 0.961±0.083图 2b。在 CAMI 小鼠数据集中protal 可恢复相对丰度低至0.0004%的真阳性低于 MetaPhlAn 40.0012%与 sylph0.0023%的检测下限。随着群落复杂度增加protal 是唯一假阳性计数与丰富度无关的 profilerR0.16不显著从而在高复杂度下保持了精度。计算性能方面在 10 个 CAMI 气道宏基因组的基准中protal 完成基准耗时 19 分 45 秒比 MetaPhlAn 4 快约 4.3 倍比 mOTUs4 快约 4.1 倍protal-mini 更快17 分 52 秒内存占用仅 12 GB完整数据库为 59 GB。Figure 2 图注宏基因组分类学分析谱工具的对比基准测试。(a) 各工具在九大基准数据集上的物种水平 F1、灵敏度与精度(b) 预测与期望物种丰度的 Pearson 相关系数© 配对 t 检验评估各工具在分类层级上的 F1 显著性优势(d) 计算性能对比(e) 随机森林特征重要性。结果3protal 以更短运行时间实现菌株分辨分析谱protal 通过为每个在至少三个宏基因组中检测到的物种构建参考引导的标记基因多序列比对进而使用 IQ-TREE 推断系统发育从而实现种内系统发育解析。在 STRAIN46 合成数据集200 个宏基因组46 个细菌物种的基准测试中protal 端到端比 MetaPhlAn 4 StrainPhlAn 4 快6-40 倍图 3a。在 64 个样本时protal 完成分析谱与菌株解析耗时 22 分钟而 MetaPhlAn 4 StrainPhlAn 4 耗时 7.9 小时128 个样本时分别为 41 分钟与 11.8 小时。在比对质量方面protal 恢复的基因组中94.5% 无任何错配位点平均每基因组 0.13 个错误而 StrainPhlAn 4 仅 9.5% 无错配平均 4.9 个错误。由于 protal 默认保留恒定比对位置其比对长度约为 StrainPhlAn 4 的 30 倍每物种中位数 118 kb vs 4.0 kb在每位点错误率上 protal 同样远低于 StrainPhlAn 42.5×10⁻⁶ vs 2.5×10⁻³。在菌株单系性monophyly方面protal 与 StrainPhlAn 4 整体表现相当0.868±0.244 vs 0.878±0.236p0.30。在系统发育树相似性上由于 protal 保留恒定位置其树枝长度与全基因组参考在同一尺度上可比——protal 的树枝长度是金标准树的 0.64 倍而 StrainPhlAn 4 的可变位点比对使树枝长度膨胀约 20 倍protal 的树枝得分距离branch-score distance比 StrainPhlAn 4 近约50 倍中位数 0.012 vs 0.580树拓扑结构恢复程度两者相当。Figure 3 图注Protal 以更短的运行时间实现菌株分辨分析谱。(a) protal 与 MetaPhlAn 4 StrainPhlAn 4 的端到端运行时间对比(b) 按物种分层的每基因组比对错误数© 标记基因多序列比对质量对比(d) 菌株单系性随最近邻相似度变化(e) 推断的系统发育树与金标准树的相似性指标。方法学参考GTDB r226物种代表基因组提取通用单拷贝标记基因细菌120个/古菌53个构建flex-map索引core-mer精确查找flex-mer排序读段同步mer种子提取flex-map候选定位锚点分组与波前比对扩展SAM格式输出比对结果记录物种特异性唯一k-mer随机森林分类器物种判定基于标记基因深度中位数估丰度多样本参考引导MSA构建qcmsa.py质量控制与过滤IQ-TREE GTR模型推断种内系统发育物种与菌株分辨分析谱输出本研究方法体系的核心创新与可借鉴之处包括core-mer 与 flex-mer 双层 k-mer 策略core-mer 为 31-mer 中央的 15-mer用于精确查找flex-mer 为中央 core-mer 两侧各 8 nt 组成的 16 nt 序列用于对具有相同 core-mer 的候选匹配进行排序。二者存储于自定义的哈希数据结构 flex-map 中记录标记基因位置、分类单元身份与 k-mer 唯一性信息。随机森林物种判定使用 512 棵树、最大 256 个叶节点的随机森林分类器在 581 个合成宏基因组样本上训练整合长唯一 k-mer 基因率、期望基因存在率、平均比对一致度与覆盖变异等特征进行物种存在判定。参考引导多序列比对RG-MSA概念上类似于 ViralMSA通过参考引导策略以线性运行时间随样本数扩展实现高效菌株分辨。多维度基准测试设计包括基于 CAMI2 的标准基准、针对单基因组代表稀有物种的 R.Sp. 基准、万物种高复杂度模拟以及包含 46 个物种的 STRAIN46 菌株解析基准全面评估工具在灵敏度、精度、丰度估计与系统发育重建上的表现。总结protal 证明了基于比对的宏基因组分析谱可以被优化至适用于大规模研究的速度同时保留菌株分辨分析所需的核苷酸信息。在合成基准测试中protal 结合了完整的 GTDB 物种覆盖度、高物种水平精度与灵敏度、准确的丰度重建以及比现有基于比对的分析谱工具显著更快的运行时间。不同于纯粹的基于 k-mer 的方法protal 同时为检测到的物种重建标记基因比对从而在同一工作流程中实现种内系统发育的从头推断。这一定位使 protal 非常适用于需要同时进行物种水平分析谱与菌株追踪的大规模宏基因组集合。protal 当前仍存在若干局限首先protal 目前不能在单个宏基因组内解析多个同种菌株菌株分辨分析限于具有主导菌株信号的场景其次物种检测依赖于参考分类体系的质量嵌合参考基因组、不精确的分类边界、水平基因转移与同源重组都会降低特异性第三protal 依赖通用标记基因菌株比较基于约 5% 的基因组这限制了其对仅有极少替代的菌株的分辨能力。此外protal 目前仅限于原核物种与短读段宏基因组数据未来版本将扩展至真核生物与长读段宏基因组数据。protal-mini 数据库20 个标记基因将内存占用降低约 5 倍12 GB vs 59 GB仅适度降低分析谱精度F1 0.945 vs 0.969使物种分析谱在笔记本电脑级硬件上成为可能。参考文献Fritscher, J., Duncan, A., Hildebrand, F. (2026). Protal: profiling through alignment — a strain-resolved analysis.bioRxiv. doi: https://doi.org/10.64898/2026.08.03.742433Parks, D. H. et al. (2022). GTDB: an ongoing census of bacterial and archaeal diversity through a phylogenetically consistent, rank normalized and complete genome-based taxonomy.Nucleic Acids Research50, D785-D794.Blanco-Miguez, A. et al. (2023). Extending and improving metagenomic taxonomic profiling with uncharacterized species using MetaPhlAn 4.Nature Biotechnology.Shaw, J. Yu, Y. W. (2024). Rapid species-level metagenome profiling and containment estimation with sylph.Nature Biotechnology.Wood, D. E., Lu, J. Langmead, B. (2019). Improved metagenomic analysis with Kraken 2.Genome Biology20, 257.Meyer, F. et al. (2022). Critical Assessment of Metagenome Interpretation: the second round of challenges.Nature Methods19, 429-440.软件与数据库https://github.com/4less/protalhttp://protal.earlham.ac.uk