
MUMmer 快速基因组比对完整指南一条命令比完两个基因组【免费下载链接】mummerMummer alignment tool项目地址: https://gitcode.com/gh_mirrors/mu/mummer手里握着两个 FASTA 文件——一个是参考基因组一个是新组装的草稿。你想知道的不是能不能比对而是差异到底在哪哪里多了一段、哪里倒了个方向、SNP 又有多少个。MUMmer 就是为这种场景准备的序列比对工具。它把整个基因组比对拆成两步先在两条序列里找出所有一模一样的地标精确匹配片段再把相邻地标聚成簇、逐段补全细节。 凭什么快秒级找地标几十兆内存跑完看两个数字就明白它的量级MUMmer 3.0 在 13.7 秒内找完两个 5Mb 基因组之间所有 ≥20bp 的精确匹配内存只用了约 78MB。对比一下同版本的 nucmer 比对两个细菌基因组通常只要几秒到几分钟就算上到两个哺乳动物基因组在 32 核、64GB 内存的工作站上也要大约 3 小时——对这类规模的基因组而言已经算克制。工具集也不止一个程序nucmer 负责 DNA 序列比对promer 通过六框翻译做蛋白质水平比对repeat-match 在单条序列里找精确重复show-coords、show-snps、show-diff、delta-filter 负责把结果变成可读的报告mummerplot 出图dnadiff 则把整套流程打包成一条命令。一条命令完成 DNA 序列比对安装是标准三件套。从源码编译git clone https://gitcode.com/gh_mirrors/mu/mummer cd mummer ./configure make sudo make install依赖只需 GCCg ≥ 4.7、GNU make 和 Perl要画图的话再装一个 gnuplot。比对本体就一行。ref.fa 是参考qry.fa 是查询-p 指定输出前缀nucmer -p out ref.fa qry.fa跑完你会拿到一个out.delta文件。注意它不是给人直接看的比对信息用 delta 编码压缩在里面体积很小却是后面所有分析的唯一入口——show-* 系列程序、mummerplot、delta-filter 全部吃这个文件。你可以把它理解成一次比对的原始底片坐标、SNP、断点、图都是从这张底片上冲出来的。 用点图和覆盖图读懂比对结果先看坐标。show-coords 把 delta 文件展开成表格每行一段比对附参考/查询序列上的起止位置、长度、同一性百分比、覆盖率show-coords out.delta out.coords再上工具自带的示例数据感受一下。docs/web/examples/data/ 里备好了幽门螺杆菌和果蝇的切片序列可以直接拿来跑mummerplot -l out.deltamummerplot 会生成点图dotplot和覆盖图两种。仓库里的示例点图长这样点图怎么读横轴纵轴各放一条序列匹配落在 (i, j) 位置就画一个点。共线性好的区域连成 45° 对角线——红色是正向匹配绿色是反向互补匹配。对角线断开、跳段、出现斜率突变的地方往往就是插入、缺失、倒位或重复待命的位置。覆盖图是一维的回答另一个问题参考基因组上哪些区段被查询序列盖住了。新组装比对回参考时图上露出的空白段就是组装没覆盖到的地方。三个典型任务组装验证、菌株差异、远缘物种组装验证。把新组装 qry.fa 映射到已完成的参考基因组上用 show-coords 的 -c -l 选项能判断每段比对是否横跨整条 contig。覆盖图上的空白、点图上跳来跳去的绿色碎片分别指向缺失区段和结构重排是快速定位组装错误的两个入口。菌株/物种间差异分析。同一物种两个菌株或者同一样本的两个组装用 dnadiff 一条命令跑完它内部调 nucmer 建比对再自动跑 delta-filter、show-snps、show-diff输出 .report汇总统计、.snpsSNP 与 indel 清单、.rdiff/.qdiff按类型分类的断点GAP、DUP、BRK、JMP、INV、SEQ。结构变异检测就落在 show-diff 这里——倒位、重复、易位会被标出来注意它的断点计数每个事件算两次事件两端各一个。远缘物种的蛋白水平比对。两个物种 DNA 序列已经分得太开、nucmer 找不出像样的匹配时换 promer输入还是 DNA它在六个阅读框上翻译后按氨基酸比对。果蝇 2R 染色体的比较就是这类场景示例数据里 D_melanogaster 与 D_pseudoobscura 的 contigs 可以直接试。小提醒promer 输出的坐标仍以核苷酸计但 delta 整数以氨基酸计1 个 delta 整数 3 个核苷酸读报告时别混淆。️ 参数速查与避坑常用参数一张表说清参数作用什么时候动它--minmatch精确匹配锚点的最小长度序列相似度高、想提速降噪时调大默认 20--mincluster聚成一个比对簇所需的最少锚点数过滤零星假匹配时调大--maxmatch使用所有最大精确匹配做锚点默认只用参考序列中唯一的匹配重复区分析时开启--mum只用在参考和查询中都唯一的匹配做锚点重复丰富、假比对多时--maxgap比对延伸允许的最大间隙长度内存吃紧、序列差异大时调小--breaklen延伸遇到低分区域时最多续推多远默认 200想省内存和时间就调小三种常见坑的解法内存告急先调小--breaklen、调大--minmatch把延伸阶段的搜索范围压下去比对完用 delta-filter 精简输出。跑得慢提高--minmatch直接减少锚点数量重复多的基因组可加--mum限制为唯一匹配。输出文件过大delta-filter 的-1保留一对一的最优比对找 SNP 常用-m保留多对多映射结构分析常用。 继续深入文档、示例与社区三个 README 最值得先读docs/nucmer.README 讲 DNA 比对的全部选项docs/promer.README 讲蛋白水平比对的坐标体系docs/dnadiff.README 逐列解释报告文件里每个字段的含义。示例目录 自带幽门螺杆菌和果蝇的切片序列配合现成的 .delta、.coords、.delta 点图适合边对照边复现整个流程。打开终端把你手头那两个基因组文件喂给 nucmer——第一次跑通之后差异在哪图会告诉你。【免费下载链接】mummerMummer alignment tool项目地址: https://gitcode.com/gh_mirrors/mu/mummer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考