尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

CD-HIT 快速上手:几分钟完成序列聚类与去冗余,含参数速查和结果排查

CD-HIT 快速上手:几分钟完成序列聚类与去冗余,含参数速查和结果排查 CD-HIT 快速上手几分钟完成序列聚类与去冗余含参数速查和结果排查【免费下载链接】cdhitAutomatically exported from code.google.com/p/cdhit项目地址: https://gitcode.com/gh_mirrors/cd/cdhitCD-HIT是一款按序列相似度对蛋白质/核酸序列做聚类的开源工具能从大规模序列库中去冗余输出非冗余的代表序列集和簇归属信息。本教程面向新手带你跑通最小流程、调好关键参数、看懂 .clstr 结果文件并处理内存不足、结果过碎、速度偏慢等常见问题。CD-HIT 适合解决什么问题大蛋白库去冗余把 UniProt 等大库建成参考库。聚类后得到非冗余代表序列集后续 BLAST 或功能标注通常快很多。转录组 / EST 核酸聚类用cd-hit-est阈值一般取 0.95–0.97在基因或异构体级别做序列去冗余。16S rRNA OTU 分析usecases/Miseq-16S目录内有现成的 MiSeq 双端读长流程样本与参考库一起聚类直接得到 OTU 及其注释。它为什么快CD-HIT 先按长度排序序列再用 k-mer 短词过滤跳过大部分明显不相似的序列对避免了全量两两比对单机即可处理数千万条序列。 最小可运行示例先确认命令可用cd-hit -h最短的蛋白质聚类命令只有一行cd-hit -i input.fasta -o result -c 0.9 -n 5 -T 8 -M 16000输入是input.fastaFASTA 格式输出两个文件result.fasta代表序列和result.clstr簇组成。核酸序列改用cd-hit-est并把-n改成10。关键参数怎么选参数作用建议值或经验值-i输入 FASTA 文件必填-o输出前缀生成 .fasta 与 .clstr必填-c聚类同一性阈值蛋白 0.9核酸 0.95–0.97-nk-mer 词长蛋白 5核酸 10-T线程数设为物理核数0 表示全部-M内存上限MB16GB 机器给 16000-s非代表序列相对代表序列的最短长度比默认 0混入短片段时提高到 0.9–1.0-d.clstr 中显示的序列名长度0 表示保留到第一个空格的完整名称-l短于该长度的序列直接丢弃默认 10大库可加大-n要和-c配套蛋白在 0.7–1.0 阈值用-n 50.6–0.7 用-n 4词长不匹配会导致结果不准或变慢。长度与覆盖度控制参数-s的含义见下图。结果文件怎么看result.clstr是核心结果格式如下Cluster 0 0 2799aa, PF04998.6|RPOC2_CHLRE/275-3073... * 1 2215aa, PF06317.1|O09705_9VIRU/1-2215... at 84%如果你想知道哪些序列被归为一类看.clstr里每个Cluster开头的段落段落内每行是一条成员序列。如果你想知道代表序列在哪行尾带*的就是代表序列其完整序列在result.fasta里后续分析直接用它。如果你想知道某条序列与代表有多像看at后的百分比。如果你想知道簇大小分布是否合理用根目录的clstr_size_stat.pl处理.clstr即可加-sc 1可让 CD-HIT 按簇大小降序输出方便直接看头部大簇。 性能与常见问题排查1. 内存不足现象报内存分配失败或进程被系统 OOM 杀掉。优先调整调低-M如 16000 改 8000内存不够时程序会把中间数据落盘变慢但更稳。再试什么加大-l过滤短序列、减少-T超大数据库可用cd-hit-div切分后配合cd-hit-para.pl并行跑下图即切分—并行流程。2. 结果过碎或过粗现象簇太多、每簇序列太少或一个簇里混进明显不该聚的序列。优先调整动-c。过碎就降低阈值过粗就提高阈值。再试什么用-s或-aS加长度、覆盖度约束仍不放心可开-g 1精确模式更慢序列会进入最相似的簇而不是第一个满足阈值的簇。3. 速度偏慢现象大数据集跑得比预期久。优先调整-T设为可用核数。再试什么预处理时去掉短序列和低质量序列核对-n是否与-c匹配序列量达到数亿时考虑并行脚本。延伸阅读与引用用户手册doc/cdhit-user-guide.wiki同目录还有编译好的 PDFdoc/cdhit-user-guide.pdf各版本最完整的参数说明以程序-h输出为准编译说明见根目录README版本变更见ChangeLog16S OTU 案例说明usecases/Miseq-16S/README引用格式Li W, Godzik A. CD-HIT: a fast program for clustering and comparing large sets of protein or nucleotide sequences. Bioinformatics, 2006, 22(13): 1658–1659.【免费下载链接】cdhitAutomatically exported from code.google.com/p/cdhit项目地址: https://gitcode.com/gh_mirrors/cd/cdhit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表