
如何用Enformer快速预测基因组覆盖轨迹5分钟上手教程【免费下载链接】enformer项目地址: https://ai.gitcode.com/hf_mirrors/multimolecule/enformerEnformer是一款基于Transformer的深度学习模型专为从长DNA序列中预测基因组覆盖轨迹而设计能够有效整合长程相互作用为生物学研究提供强大支持。 Enformer核心功能解析Enformer作为Basenji的继任者采用了卷积茎干加Transformer主体的创新架构能够处理约197kb的长DNA窗口通过128倍下采样后使用11个Transformer块进行处理最终生成896个输出bin每个bin代表128bp的序列信息。这种设计使其能够出色地捕捉基因组中的长程相互作用为基因组覆盖轨迹预测提供高精度结果。主要技术参数输入长度196608 bp输出bin大小128 bp输出bin数量896个隐藏层大小1536Transformer层数11层注意力头数8个人类基因组预测轨道数5313个⚡ 快速开始5分钟安装指南要使用Enformer模型首先需要安装multimolecule库。打开终端执行以下命令pip install multimolecule如果需要从源码安装可以克隆仓库git clone https://gitcode.com/hf_mirrors/multimolecule/enformer cd enformer pip install . 简单预测示例基因组覆盖轨迹预测以下是一个使用Enformer进行基因组覆盖轨迹预测的简单示例只需几行代码即可完成import torch from multimolecule import DnaTokenizer, EnformerConfig, EnformerForTokenPrediction # 加载模型配置 config EnformerConfig.from_pretrained(.) # 初始化模型 model EnformerForTokenPrediction.from_pretrained(.) # 创建随机DNA序列输入196608 bp input_sequence torch.randint(config.vocab_size, (1, config.sequence_length)) # 进行预测 output model(input_sequence) # 后处理得到覆盖轨迹 coverage, channels model.postprocess(output) # 输出结果形状(batch_size, target_length, num_tracks) print(coverage.shape) # torch.Size([1, 896, 5313]) 模型输入输出说明输入要求序列长度固定为196608 bp的DNA窗口序列类型支持DNA序列包含A、T、C、G四种碱基未知碱基用N表示输出说明原始输出形状为(batch_size, target_length, num_tracks)的logits后处理输出通过postprocess方法可得到非负的覆盖轨迹物种选择可通过配置文件中的species参数选择人类5313个轨道或小鼠1643个轨道模型 进阶使用自定义配置Enformer允许用户根据需求自定义模型配置例如调整隐藏层大小、注意力头数等参数config EnformerConfig( sequence_length196608, hidden_size1536, num_hidden_layers11, num_attention_heads8, specieshuman # 选择人类基因组模型 ) model EnformerForTokenPrediction(config) 引用与致谢如果Enformer对您的研究有所帮助请引用以下文献article{avsec2021effective, author {Avsec, {\v{Z}}iga and Agarwal, Vikram and Visentin, Daniel and Ledsam, Joseph R. and Grabska-Barwinska, Agnieszka and Taylor, Kyle R. and Assael, Yannis and Jumper, John and Kohli, Pushmeet and Kelley, David R.}, title {Effective gene expression prediction from sequence by integrating long-range interactions}, journal {Nature Methods}, year 2021, volume 18, number 10, pages {1196--1203}, doi {10.1038/s41592-021-01252-x} }本模型实现基于MultiMolecule项目相关配置文件可参考config.json分词器配置可参考tokenizer_config.json。❓ 常见问题Q: 模型支持哪些物种的基因组预测A: 目前支持人类5313个轨道和小鼠1643个轨道可通过配置文件中的species参数进行切换。Q: 输入序列长度是否可以调整A: 模型默认输入长度为196608 bp这是经过优化的最佳长度不建议随意调整。Q: 如何处理不同长度的DNA序列A: 对于短序列可以使用N碱基进行填充对于长序列需要分割成多个196608 bp的窗口进行预测。通过以上步骤您已经掌握了Enformer的基本使用方法。如需更详细的技术文档请参考项目中的相关资料。【免费下载链接】enformer项目地址: https://ai.gitcode.com/hf_mirrors/multimolecule/enformer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考