尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Illumina二代测序原理与实战:从边合成边测序到Index设计全解析

Illumina二代测序原理与实战:从边合成边测序到Index设计全解析 1. 项目概述从“读”到“测”理解Illumina测序的核心价值如果你在生物信息学或者分子生物学领域工作那么“Illumina测序”这个词组几乎每天都会听到。它早已不是实验室里高不可攀的神秘技术而是成为了基因组学研究的基石工具。但很多时候我们只是把它当作一个“黑箱”——送进去样本拿回来数据。今天我想从一个一线操作者和数据分析者的角度拆解一下Illumina二代测序现在更常被称为“下一代测序”NGS到底是怎么一回事特别是那个最近被频繁问到的“测index1”操作背后藏着哪些门道。理解这些原理不仅能让你在实验设计时少踩坑更能让你在数据分析阶段一眼看出问题所在而不是对着莫名其妙的错误结果干瞪眼。无论你是刚入门的研究生还是需要和测序平台打交道的项目负责人这篇内容都能帮你建立起一个清晰、可操作的认知框架。简单来说Illumina测序的核心思想可以类比成“给DNA分子拍一张超高通量的集体照”。它不是一次只读一条DNA长链而是将亿万条DNA片段同时固定在一个平面上让它们一边“复制自己”一边“报告自己身上的字母碱基”。这个过程高度并行化、自动化并且成本相对低廉这才使得我们今天能够进行大规模基因组测序、转录组分析、外显子组捕获等研究。而“index”或者叫“barcode”就是给这个庞大集体照中的每一个“家庭”即每个样本贴上独特的姓名标签实现多个样本混合测序Multiplexing的关键。最近“测index1”成为热词恰恰说明大家开始关注测序流程中的细节质量控制了这是好事。2. Illumina测序的核心原理拆解边合成边测序要理解整个过程我们必须先抓住它的核心——边合成边测序。这和我们以前熟悉的桑格测序一代测序有本质不同。桑格测序像是“终点判定法”而Illumina测序则是“过程直播法”。2.1 核心生化反应可逆终止与荧光报告Illumina测序的基石是使用了一种经过特殊修饰的核苷酸我们称之为可逆终止子。这种核苷酸有两个关键特性3‘端带有一个可化学切割的阻断基团。当它被聚合酶添加到正在延伸的DNA链上后由于3‘端被堵住下一个核苷酸就无法再连接上来。这就实现了“单碱基延伸”确保每次循环只加上一个特定的碱基。碱基上连接有荧光报告基团。四种碱基A, T, C, G分别标记了四种不同颜色的荧光染料。当这个带荧光的核苷酸被掺入到DNA链中时其荧光信号就会被检测系统捕获。所以一个基本的测序循环是这样的步骤一加样。将四种带有不同颜色荧光标记的可逆终止核苷酸混合溶液加入到测序芯片Flow Cell中。步骤二合成与成像。DNA聚合酶会寻找引物-模板复合物并选择与模板链下一个碱基互补的核苷酸掺入。掺入完成后所有被成功延伸的DNA簇后面会讲什么是簇都会发出特定颜色的荧光。高分辨率相机对整张Flow Cell进行拍照通过荧光颜色判断该位置对应DNA片段在这一轮循环中掺入的是哪种碱基比如绿色代表A红色代表C。步骤三切割与洗脱。通过化学方法将刚才掺入核苷酸上的荧光报告基团和3‘端的阻断基团一并切割洗掉。这样DNA链的3‘端又恢复了游离的羟基为下一个核苷酸的掺入做好了准备。如此循环往复通常是几十到几百个循环我们就得到了每一条DNA片段从起始位置开始逐个碱基的序列信息。这个过程高度平行一张标准Flow Cell上有数亿个这样的测序簇同时进行反应其数据产出量是惊人的。注意这里有一个关键细节即**“测序读长”**。读长就是指循环的次数。循环越多读得越长但错误率也会随着循环数增加而累积性上升。因为生化反应并非100%完美每一轮都有极小的错配或信号衰减可能。所以在设计实验时需要根据应用场景权衡读长和准确性。例如对于需要高精度的变异检测可能会更看重前段高质量碱基而对于宏基因组拼接则可能需要更长的读长来跨越重复区域。2.2 桥式PCR从单个分子到可检测的信号簇你可能会问单个DNA分子发出的荧光信号如此微弱怎么可能被相机检测到这就引出了Illumina测序前的一个关键准备步骤桥式PCR。测序的起始材料是打断成小片段通常200-600bp并两端加上特定接头Adapter的DNA文库。这些文库片段被注入Flow Cell。Flow Cell表面密密麻麻地固定着与接头互补的寡核苷酸引物。杂交文库片段随机地与Flow Cell表面的引物通过碱基互补配对结合。桥式扩增在聚合酶作用下以结合的片段为模板合成出一条互补链。这条新链的末端带有另一个接头序列。随后通过变性使新合成的双链解开新链的另一端会弯曲下来与Flow Cell表面另一个互补的引物结合形成“桥”状结构。循环扩增以这条弯曲固定的单链为模板再次进行延伸又生成一条双链桥。经过几十轮这样的变性、退火、延伸循环最初的那个单分子DNA片段就被局部扩增成了一个含有数千份相同拷贝的DNA簇。这个簇在显微镜下是一个明亮的光点其信号强度足以被光学系统清晰识别。每个簇都来源于一个独立的原始DNA分子因此代表了一条独立的序列。一张Flow Cell上可以形成数亿个这样的簇实现了大规模并行。桥式PCR的质量直接决定了测序数据的质量。如果扩增不充分簇信号弱测序信噪比差如果扩增过度或出现非特异性扩增会导致簇密度过高或产生“多克隆簇”一个光点里混了不同序列严重影响后续数据分辩。2.3 双端测序与Index标签样本混合与序列定位理解了单端测序我们再来看更常用的双端测序。顾名思义就是对DNA片段的两端都进行测序。第一端测序完成指定循环数如150 cycles的Read 1测序。模板再生将新合成的测序链洗脱掉剩下原始模板链仍然通过其另一端接头固定在Flow Cell上。桥式再生这条原始模板链再次弯曲与对面的引物结合形成桥并进行一轮延伸生成其互补链。这一步相当于“重置”了模板链的方向。第二端测序从片段的另一端开始进行Read 2的测序。双端测序能获得片段两端的序列信息在后续数据分析中优势巨大① 可以提高序列比对到参考基因组的准确性和唯一性② 可以检测结构变异如插入、缺失、倒位等③ 对于转录组测序可以判断是否为嵌合体或融合基因。而Index则是嵌入在文库接头中的一段短序列通常6-10个碱基。一个样本使用一种特定的Index序列。在构建文库时Index就被整合到了DNA片段上。在测序时会在正式测序Read 1之前或之后专门用几个循环来读取这个Index序列这就是“测index1”的由来对于双Index方案还有index2。Index的核心价值在于“解混”。我们可以将几十个、甚至上百个带有不同Index的样本文库按一定比例混合在一起然后上机进行单次测序。测序完成后生物信息学软件会根据每一条序列的Index序列将它们准确地“分拣”回各自所属的样本。这极大地提高了测序通量的利用率降低了单个样本的成本。3. 完整测序工作流程实操解析纸上谈兵终觉浅我们结合一个典型的全基因组重测序项目把Illumina测序的完整流程走一遍。你会看到湿实验Wet Lab的每一步都直接影响着干实验Dry Lab即数据分析的结果。3.1 阶段一样本准备与文库构建这是所有测序项目的起点也是决定数据质量的“地基”。步骤1DNA提取与质检操作从组织、细胞或血液中提取高质量基因组DNA。使用Qubit或PicoGreen进行精确定量浓度使用琼脂糖凝胶电泳或安捷伦生物分析仪检测完整性片段大小分布。为什么重要起始DNA的降解、污染或浓度不准会导致文库构建失败或偏好性。比如降解的DNA建库后片段偏小影响后续分析。实操心得对于珍贵样本宁可分装保存避免反复冻融。质检报告一定要保存好这是追溯问题的第一手资料。浓度单位要统一ng/μL体积计算要仔细。步骤2DNA片段化与末端修复操作通过超声破碎或酶切法将长链DNA随机打断成目标大小例如350bp。打断后的DNA片段末端是参差不齐的可能带有5‘突出或3‘突出。需要用酶进行末端修复将其变成平末端。工具选型超声破碎仪如Covaris参数稳定重复性好但设备昂贵。酶切法成本低便捷但可能引入序列偏好性。根据实验精度要求和预算选择。注意事项片段化的大小决定了你最终测序文库的插入片段长度。插入片段长度 测序总长度Read1 Read2 - 两端接头序列长度。设计好这个参数对后续分析至关重要。步骤33‘端加“A”与接头连接操作在平末端的DNA片段3‘端加上一个单一的“A”碱基A-tailing。与此同时Illumina的测序接头Y型Adapter的3‘端带有一个单一的“T”突出T-overhang。利用A-T配对将Adapter高效、定向地连接到DNA片段两端。核心细节这里的Adapter已经包含了后续PCR扩增引物结合位点、测序引物结合位点以及最重要的Index序列。使用“Y型”Adapter是为了防止Adapter自连提高连接效率。步骤4文库PCR扩增与纯化操作使用与Adapter序列互补的通用PCR引物进行有限循环数的扩增通常4-12个循环以富集成功连接了接头的DNA片段并引入足够的文库量用于后续步骤。扩增后使用磁珠如SPRI beads进行纯化选择性地回收目标大小的片段。关键参数PCR循环数不宜过多以防引入扩增偏好性和重复序列。磁珠纯化的比例例如0.8x, 1.0x用于去除引物二聚体和大片段这个比例需要优化它直接影响文库的片段分布。步骤5文库最终质检与定量操作使用安捷伦生物分析仪或类似的高灵敏度芯片检测文库的片段大小分布和纯度。使用qPCR方法基于文库Adapter序列进行绝对定量。这是因为qPCR只定量带有完整接头的有效文库分子比基于荧光染料的定量方法更准确。为什么必须qPCR定量Flow Cell上簇的生成效率依赖于带有完整接头的、可杂交的文库分子浓度。qPCR定量结果直接用于计算文库上样浓度。如果只用Qubit定量可能会因含有接头不完整的分子或引物二聚体而导致实际上样浓度不准最终导致簇密度异常。3.2 阶段二上机测序与簇生成文库构建好后就进入自动化程度最高的测序仪环节。步骤1文库标准化与混合操作根据qPCR定量结果将各个样本的文库稀释到相同的摩尔浓度例如4 nM。然后根据测序深度需求计算各样本的体积混合成一个Pool混合文库。混合时务必涡旋振荡混匀避免移液误差导致样本间比例失衡。避坑技巧混合后最好再次用qPCR确认一下Pool的浓度。对于非常重要的项目可以跑一个微量电泳看看混合后的片段大小是否正常防止有个别文库异常影响整体。步骤2变性与上样操作将混合文库进行碱变性使其成为单链。然后将其加载到测序仪的Flow Cell上。单链文库分子会随机地与Flow Cell通道表面的寡核苷酸引物杂交。关键点变性条件要温和且彻底。不完全变性会导致双链文库上样影响簇生成效率。步骤3簇生成桥式PCR操作测序仪自动在Flow Cell通道内进行桥式PCR循环将每个杂交的文库分子扩增成一个独立的簇。这个过程在仪器内部完成通常需要几个小时。仪器软件会实时监测簇的密度。核心参数簇密度。这是上机成败的关键指标之一。密度过低如100K/mm²数据产出量不足浪费通量密度过高如1400K/mm²簇与簇之间距离太近信号互相干扰称为“簇交叉对话”导致测序错误率飙升特别是影响Index读取的准确性这就是为什么“测index1”出错常与高簇密度相关。理想的簇密度因测序仪型号和试剂版本而异需要参照官方指南。步骤4测序循环运行操作簇生成后测序仪开始执行预设的测序程序。程序会按照你的设置依次进行Read 1 Index 测序如果使用双Index且Index在i7端先读i7 Index。Read 1 测序读片段的第一端。Index 2 测序如果使用双Index读i5 Index。Read 2 测序读片段的第二端。流程设计你需要在提交测序任务时在仪器控制软件中精确设置每个“段”的循环数。例如“Read1: 150 cycles, i7 Index: 8 cycles, i5 Index: 8 cycles, Read2: 150 cycles”。顺序不能错。3.3 阶段三初级数据分析与数据交付测序仪运行结束后产生的并不是我们直接能用的FASTQ文件而是需要经过仪器内置软件进行初级分析。步骤1图像分析与碱基识别操作测序仪软件将每个循环拍摄的荧光图像进行处理。对于Flow Cell上的每一个簇对应一个“点”软件会追踪其在整个测序过程中每一轮循环的荧光颜色强度变化。通过算法将这些荧光信号变化轨迹转换成碱基序列并给出每个碱基的质量值Phred Quality Score, Q score。这个步骤生成的是每个簇的原始碱基序列文件BCL文件。质量值Q这是衡量碱基识别可靠性的关键指标。Q -10 * log10(P)其中P是该碱基识别错误的概率。Q20表示错误概率为1%Q30表示错误概率为0.1%。通常我们会要求Q30碱基占比达到一定标准如85%。步骤2数据拆分操作软件根据每一条序列的Index序列将混合测序产生的所有数据“拆分”到各个样本名下。它会检查Index序列与预设样本Index列表的匹配情况。允许1-2个碱基的错配可设置但会标记出来。“测index1”问题高发区拆分失败或拆分错误通常发生在这里。原因可能包括① Index序列设计不合理彼此间相似度太高容易串扰② 文库定量不准导致某些样本的文库在Pool中占比极低其Index信号弱③ 簇密度过高导致Index读取时信号交叉污染④ Index序列在合成或PCR过程中发生错误。因此在设计实验时要选用经过验证的、差异足够的Index组合建库后最好用微量测序如MiSeq先跑一个快速测试验证Index分配是否正确。步骤3生成FASTQ文件操作数据拆分后软件为每个样本生成对应的FASTQ文件。FASTQ文件是标准的测序数据文本格式每条序列占四行序列标识符、碱基序列、一个“”分隔符、每个碱基对应的质量编码。交付物最终你会拿到每个样本的R1.fastq.gz和R2.fastq.gz双端测序文件以及一份包含测序质量统计信息的HTML报告。你的测序之旅至此才算完成了“数据生产”环节接下来就进入更复杂的生物信息学分析阶段了。4. 关键参数解析与实验设计考量理解了流程我们再来看看几个决定实验成败和成本效益的关键参数它们需要在项目启动前就深思熟虑。4.1 测序深度与覆盖度这是两个最常被混淆的概念。测序深度也叫乘数指每个碱基被测序的平均次数。例如对一个100 Mb的基因组进行30x测序意味着产生了总计3 Gb的原始数据量。深度越高检测低频变异的灵敏度越高但成本也线性增加。覆盖度指基因组中被至少一条测序读段覆盖到的区域所占的百分比。由于基因组中存在难以测序的区域如高GC区、重复序列即使深度很高覆盖度也可能达不到100%。如何选择深度人类全基因组重测序寻找常见变异30x是基准线寻找低频或体细胞突变可能需要60x甚至100x以上。外显子组测序通常建议100x以上因为目标区域小需要更高深度来保证每个外显子都被充分覆盖。转录组测序对于基因表达定量通常20-30M的成对读段Read Pairs per sample 是常见起点差异表达分析需要根据预期效应大小和组内变异来估算。16S rRNA宏基因组取决于微生物群落复杂度通常每个样本5-10万条读段可能就足够进行群落结构分析。计算公式简化所需总数据量Gb 基因组大小Gb × 目标测序深度x。然后根据单个测序lane的通量例如NovaSeq 6000 S4 flow cell约1200-1500Gb和样本数量来规划需要多少个lane以及每个样本的混合比例。4.2 读长选择短读长 vs. 长读长应用场景Illumina目前主流读长是150bp双端PE150也有300bp双端的试剂但通量较低错误率在第二端会升高。PE150的适用场景绝大多数应用包括全基因组重测序、外显子组测序、转录组测序RNA-seq、ChIP-seq、靶向测序等。它在准确性、通量和成本之间取得了最佳平衡。需要考虑更长读长的场景宏基因组de novo拼接长读长有助于跨越重复区域将contig拼接成更长的scaffold。结构变异检测长读长能更好地跨越大的插入/缺失或倒位区域。全长转录本测序需要捕捉从5‘到3’UTR的完整信息。HLA分型高度多态性的区域需要长读长来准确分型。注意当遇到需要长读长的研究问题时不应只局限于提升Illumina的循环数成本高错误率累积。现在更主流的方案是结合使用Illumina短读长数据和第三代长读长测序技术如PacBio HiFi或Oxford Nanopore。用Illumina数据的高准确性来校正长读长的错误实现高质量的长片段组装。4.3 Index设计与多重测序策略Index是多重测序的钥匙设计不好会直接导致数据报废。Index设计原则最小化编辑距离任意两个Index序列之间至少应有2-3个碱基的差异汉明距离。这样即使有一个碱基测错软件也能将其正确识别并归类或者标记为低质量。平衡碱基组成避免使用连续相同的碱基如AAAAAA或单一碱基占比过高这会影响簇生成和测序效率。避免与接头或常用序列同源防止在PCR或测序过程中发生错配。使用经过验证的Index组合Illumina官方提供多套经过验证的Index组合如TruSeq, Nextera这是最安全的选择。自定义Index需要经过严格测试。双Index vs. 单Index单Index只有一个Index序列通常在i7位置。样本混合数量有限且一旦Index跳号Index Hopping即一个簇的Index被错误地识别为另一个无法纠正。双Index有两个Index序列i7和i5。样本混合能力成倍增加组合数 i7种类 × i5种类。更重要的是它能有效降低Index跳号的影响。因为两个Index同时跳号到另一个有效组合的概率极低。软件可以将双Index都不匹配的读段识别出来归类为“未分类”提高了数据分配的纯净度。对于珍贵样本或要求高准确性的项目强烈推荐使用双Index。5. 常见问题排查与数据质控实战测序完成后拿到FASTQ文件不是终点而是数据分析的起点。第一步永远是质控。这里分享几个我踩过坑才学会的排查技巧。5.1 原始数据质控FastQC报告解读FastQC是必用的质控工具。看报告要抓大放小重点关注以下几项Per base sequence quality这是生命线。通常前几个碱基质量会稍低因为测序起始不稳定但整体应该在高位绿色区域。如果中间或末尾质量断崖式下跌可能提示测序试剂耗尽或Flow Cell问题。Per base sequence content正常情况下A/T/C/G四种碱基在每个测序位置的比例应该大致平衡且波动不大。如果前10-15个碱基比例不平衡是正常的由于随机引物起始但如果整个读段都不平衡可能提示有测序引物污染或文库本身有严重偏好性比如某些建库方法。Adapter Content检查测序读段中是否残留接头序列。如果接头含量很高说明插入片段长度太短测序读长超过了片段本身读穿了。这需要在建库时优化片段筛选条件或者在数据分析时必须进行接头切除。Overrepresented sequences检查是否有某些序列被极度高丰度地测到。这可能是PCR重复的迹象即同一个原始分子被过度扩增也可能是载体污染或实验室常见污染物如核糖体RNA。需要结合具体序列进行BLAST排查。5.2 Index跳号与样本交叉污染这是多重测序中最令人头疼的问题之一。即使使用了双Index也无法完全杜绝。现象在数据拆分后发现某个样本中有相当比例的读段其双Index组合不属于该样本而是属于Pool中另一个样本的Index组合。可能原因物理污染建库过程中样本间发生了交叉污染。这是最严重的问题需要在实验操作中严格防止。Index跳号在簇生成或测序过程中由于化学或光学原因一个簇的Index信号被错误地识别。双Index可以大幅缓解但不能根除。Index序列设计不佳Index间相似度高容易误判。排查与应对设置阴性对照在文库构建和Pooling时加入一个不含模板DNA的阴性对照水对照。如果阴性对照中检出大量数据且Index属于其他样本则强烈提示存在交叉污染。分析“未分类”读段关注数据拆分报告中“未分类”读段的比例和其Index组成。如果“未分类”读段中大量出现Pool中已有的Index组合可能是跳号。使用UMI对于超低频变异检测如ctDNA可以考虑在建库时加入唯一分子标识符。UMI可以在生物信息学分析中识别并校正PCR重复和部分跳号影响。5.3 簇密度异常与数据产出不足现象测序报告显示簇密度远低于预期导致总数据量不达标。可能原因链式排查文库定量问题是否用了qPCR定量Qubit定量会高估有效文库浓度。重新用qPCR检测文库Pool的浓度。文库质量问题跑胶或安捷伦芯片查看文库片段大小是否正确是否有严重的引物二聚体峰~100bp引物二聚体会竞争性结合Flow Cell但无法形成有效簇。文库变性问题变性是否充分不完全变性会导致双链文库上样无法杂交。Flow Cell或试剂问题是否使用了过期试剂Flow Cell是否有瑕疵这需要联系测序服务商或工程师。预防措施建库后、上机前用qPCR精确定量文库Pool对于重要项目用微量测序仪先跑一个Nano或Micro规格的测试验证文库质量和Index分配。5.4 测序质量在Read2末端下降这是Illumina测序的一个常见现象尤其是较长读长时。原因在双端测序中Read2是从模板链的另一端开始读。随着循环数增加聚合酶活性可能下降荧光基团切割效率可能不完全导致信号衰减背景噪声增高碱基识别准确率下降。应对湿实验层面遵循最新的试剂操作指南确保试剂新鲜避免反复冻融。数据分析层面在比对前使用Trimmomatic、Cutadapt等软件对原始读段进行质量修剪将Read2末端低质量的部分切掉。虽然损失了一些长度但提高了后续比对的准确性。理解Illumina测序的原理和全过程就像掌握了地图和指南针。它不能保证你的每一次航行都一帆风顺但能在遇到风浪时让你知道问题可能出在哪个环节应该朝哪个方向调整。从精心的实验设计、严谨的文库构建到仔细的上机规划和严密的数据质控每一步都环环相扣。当你再看到“测index1”这样的热词时希望你能立刻联想到它背后的完整逻辑链——从Index序列的设计到PCR引入再到簇生成和光学读取最终在数据拆分环节见分晓。这份全局观是高效利用这台强大工具并从中获取可靠生物学发现的最重要保障。
返回列表