分类: 默认分类

  • 外显子测序

    外显子测序(Exome Sequencing)是一种高通量测序技术,专门用于测定基因组中所有外显子(即编码蛋白质的基因部分)的序列。对外显子进行测序,需要大量的外显子探针。

    基于公共数据库(如RefSeq、Ensembl等)中的已知外显子序列信息,设计一系列与目标外显子互补的短DNA序列作为探针。

    外显子是mRNA的子集,测序前需要先提取出mRNA,在利用已经设计好的外显子探针文库与mRNA文库杂交获取。这些探针经过生物素修饰,生物素链霉亲和素能形成非常稳定的共价键,因此,可以作为连接DNA与磁珠的媒介。链霉亲和素修饰的磁珠可以把生物素修饰的外显子片段拉取下来。

    外显子片段经过洗脱,PCR扩增,然后上机测序。

    它的最大弊端是,PCR扩增后的相同片段是非常大量的,属于冗余片段,重复对冗余片段测序意义不大,而且会减少有价值测序结果的比例。在分析时,需要有专门的步骤将冗余片段去除。

    外显子测序比其他测序的优势在于,相同数据量的测序,外显子测序比其他测序的深度更深,适合用于分析肿瘤等疾病。

  • RNA测序

    通过试验提取的RNA绝大部分使rRNA(核糖体),这部分RNA的序列的高度保守的,我们测序它们并不会得到多少有用的信息。我们需要测定的实际上需要测定的是mRNA(信使RNA),mRNA上的序列决定了蛋白质的氨基酸序列,从而决定了蛋白质的结构和功能。

    高等生物,成熟mRNA的3’端,会有一个Poly(A)尾巴。poly源自希腊语,是一个前缀,表示很多很多。因此,设计一个Poly(T)探针,用于结合Poly(A),探针连有磁珠,利用磁性,可以把带有Poly(A)的mRNA分离出来。

    接下来,用Mg2+溶液打断mRNA序列,然后用随机引物逆转录成cDNA,并补齐双链。

    在双链的两边加上Y型接头,完成建库过程。

    这种测序方案有一个很大的弊端,那就是Ploy(T)探针只能拉Ploy(A)。当mRNA序列完整的情况下,效果非常好,当出现了讲解,mRNA不再是5’到3’的完整序列时,靠近5’的序列会缺失。所以,RNA的完整性在该方案中起到非常重要的作用。

  • 火山图怎么看

    火山图(Volcano Plot)是生物信息学中常用的一种图形,用于展示基因表达数据的变化情况,特别是在基因表达差异分析中。在火山图中,横坐标通常表示基因表达差异的大小,而纵坐标表示这种差异的统计显著性。

    如果使用对数变化比作为横坐标,那么火山图的中心(x=0)表示基因表达没有变化,向左表示下调(负变化),向右表示上调(正变化)。

    纵坐标则是表示统计显著性的值,通常是-log以10为底的P值的对数。这样表示的目的是让具有高统计显著性(即小的P值)的点在图上位于更高的位置,从而便于观察。

    通常,还用两种颜色标出火山图,阈值上方的颜色表示差异显著。

  • 聚合酶链式反应(PCR)的由来和原理

    PCR技术的由来

    说到聚合酶链式反应(Polymerase Chain Reaction,PCR),那绝对是一项划时代的技术,绝对是目前最常用的分子生物学技术之一。它实现了DNA片段的体外扩增,让基因研究变得更加容易。这种方法由美国科学家Kary Mullis在1983年发明,因此他于1993年获得了诺贝尔化学奖。PCR技术的核心是利用DNA聚合酶扩增特定的DNA片段。

    那么什么是DNA聚合酶呢?1956年,美国科学家Arthur Kornberg和他的同事从大肠杆菌(Escherichia coli)中发现了一种酶,可以合成新的DNA链,他也因此获得了1959年的诺贝尔生理学或医学奖。DNA聚合酶的发现主要是源自Arthur对生命基本过程,特别是遗传信息的复制机制的深刻兴趣。在20世纪50年代,虽然DNA已经被确认为遗传物质,但DNA如何被准确复制和传递给子代的分子机制仍然是一个未解之谜。Arthur希望通过研究找到并了解那个负责复制DNA的酶,以揭示遗传信息复制的分子基础。

    Arthur和他的团队专注于酶学和代谢途径的研究,他们利用细菌系统,尤其是大肠杆菌,因为它们的生长速度快,容易处理。他们的工作集中在寻找能催化DNA合成的酶,这一过程最终导致了DNA聚合酶I的发现。这项发现证明了DNA的复制是由特定酶催化的,从而为理解遗传信息的精确复制提供了关键的分子机制,也为PCR技术的发展奠定了基础。遗憾的是聚合酶I并不适合PCR,因为它不耐热,同时还具备3’到5’的外切酶活性。

    1966年,美国加州大学伯克利分校的生物化学家Thomas D. Brock在黄石国家公园发现了一种能在极端高温环境中生存的细菌——水生嗜热菌(Thermus aquaticus)。1976年,Thomas的学生Chien发现了这种细菌产生的一种耐热的DNA聚合酶——Thermus aquaticus DNA polymerase,也就是我们所说的Taq DNA聚合酶。Taq酶可以耐受近100℃的高温,这使得它非常适合PCR技术。PCR在每个循环中都需要经历高温变性步骤,而普通的DNA聚合酶无法在这种高温下保持活性。Taq酶的发现成为推动PCR技术广泛应用的关键因素之一。

    1983年,美国化学家Kary Mullis在加州大学旧金山分校发明了PCR技术。

    Kary的故事

    Kary Mullis并没有接受过正规的大学教育。他1944年出生于北卡罗来纳州,家境贫寒。18岁时加入了美国空军,在空军服役期间自学了生物化学。后来他辗转做过多份工作,包括在一家面包店打工、在一家生物技术公司当技术员等。1983年,Kary当时在Cetus公司工作,有一次,他在沿着太平洋月光海滩散步时,突然想到了PCR的概念——利用DNA聚合酶在每个循环中复制DNA的方法来指数级扩增目标DNA序列。1985年4月,Kary与同事们在Cetus公司的实验室里首次成功实现了PCR反应。1986年,Kary等人在《Science》杂志上正式发表了关于PCR技术的论文。

    PCR技术的一般步骤

    1. 初始化步骤

    这一步骤通常涉及将反应混合物加热至高温(通常95°C左右),用于激活热稳定DNA聚合酶(如Taq聚合酶)。在首次加热时,也会使DNA模板完全变性。这一步通常在整个PCR过程的最开始只进行一次,持续时间约为1至9分钟。

    2. 变性

    在这一步骤中,整个反应混合物被加热至94-98°C,通常持续15-30秒。这个高温会导致双链DNA解旋,形成两个单链DNA模板。

    3. 引物退火

    温度降低至50-65°C,具体温度取决于使用的引物的熔解温度(Tm),也就是使双链DNA(或DNA/RNA杂交物)50%解链所需的温度,持续20-40秒。温度过低,容易发成错配,也不利于酶的活性和速率。

    4. 延申

    温度再次升高至72°C(Taq酶的最适工作温度),在此温度下,DNA聚合酶开始从引物处沿模板DNA合成新的DNA链。这一步骤通常持续约1分钟,对于每1kb的DNA序列长度大约需要1分钟。重复2-4过程,30个循环以上。

    5. 最终延申

    这一步骤在最后一个循环之后进行,目的是确保所有剩余的单链DNA模板都被完全延伸。温度设定在72°C,持续时间约5-15分钟。

    6. 终止反应

    PCR程序完成后,通常会有一个最终的保温步骤,这一步骤在4-15°C进行,用于短期存储PCR产物,直到它们可以被进一步处理或分析。30个循环理论上可以得到229个目标片段(扩增子)

    前两个循环动画演示

  • 插入缺失与结构变异

    插入缺失(indel)是insertion和deletion的缩写,通常是小于50bp的少量插入和缺失突变。

    相对的,大片段的变异我们叫做Structure variation,简称sv。包括:(1)染色体内部的位移;(2)染色体之间的移位;(3)大片段的缺失;(4)大片段的插入;(5)大片段的加倍;(6)倒位;

  • 常用的标准化方法

    标准化(Normalization)也叫归一化。它是一种常用的数据预处理技术,它可以将数据缩放到一个较小的特定区间,通常是[0,1]或[-1,1]区间。标准化的目的是消除数据之间的量纲影响,使不同量纲或数值范围差异较大的特征在模型训练时具有相同的权重。

    Min-Max标准化

    X'=(X-X_{min})/(X_{max}-X_{min})

    min是最小值,max是最大值。

    Z-Score标准化

    X'=(X-\mu)/\sigma

    μ是均值,σ是标准差。

  • 单通道基因芯片的简单试验设计

    试验设计

    最简单的实验设计包括处理组(k1)和对照组(k2),即k=2,每个k检测若干个材料n,每个材料使用一张芯片r=1。总体方差包括了材料间的误差(σs2)、芯片间的误差(σa2)、处理之间的差异(QTrt)。

        展开Mermaid代码     graph LR
            设计 --> 处理组 -->n1[n个材料]
              设计 --> 对照组 -->n2[n个材料]

    方差与自由度

    来源自由度期望均方
    处理(Trt)k – 1
    材料(Trt)k(n – 1)
    芯片(材料 Trt)kn(r – 1)

    Q_{Trt}+r\sigma^2_s+\sigma^2_a

    r\sigma^2_s+\sigma^2_a

    \sigma^2_a

    期望均方(Expected Mean Square,EMS)是统计学和实验设计中的一个概念,特别是在方差分析(ANOVA)中经常遇到。期望均方表示的是某个特定来源的变异对总变异的贡献量的期望值。简单来说,它是对变异来源(如处理效应、实验误差等)贡献的平均大小的一个度量。

    在方差分析中,我们通常关注不同因素(如不同的实验处理、实验条件、测量误差等)对观测数据变异的贡献。期望均方是通过将某一变异来源的平方和(SS,Sum of Squares)除以其相应的自由度(DF,Degrees of Freedom)来计算的。期望均方可以帮助我们理解数据中不同因素的相对重要性。

  • 测序中的phasing和prephasing

    在边合成边测序的时候,往往会出现荧光信号不准确的情况,引起这种情况的原因通常有两个。第一个是phasing,一个是prephasing。

    phasing表示当反应池中的DNA连接酶不足时,碱基没有向下继续延申,而停留在之前的位置。

    prephasing表示当3’叠氮基团脱落,导致羟基裸露,反应持续向下进行一个碱基,导致荧光信号不同。

  • NCBI介绍

    本文域名:https://wp.me/p80aHo-1jf

    全称

    NCBI是National Center for Biotechnology Information的缩写,(美国)国家生物技术信息中心。域名为https://www.ncbi.nlm.nih.gov/

    域名解读

    • www表示万维网(World Wide Web)
    • ncbi(National Center for Biotechnology Information)是(美国)国家生物技术信息中心的缩写
    • nlm(National Library of Medicine)(美国)国家医学图书馆
    • nih(National Institutes of Health)美国国立卫生研究院
    • gov(government)政府官方网站。

    因此,NCBI的所属关系就很清晰了,美国政府→国立卫生研究院→国家医学图书馆→国家生物技术信息中心。

    NCBI的使命

    概况

    四种DNA碱基编码了生命的世界。解开A、T、C、G编码的含义并应用到新物质的创造中是分子生物学的核心。分子生物学数据不仅神秘而且数量巨大,解开它的奥秘必须使用计算机数据库以及专门的分析工具。我们致力于开发创新方法来应对复杂的海量数据,并为研究人员提供改进的分析工具,以增进我们对遗传、健康和疾病的理解。

    创建

    已故参议员克劳德·佩珀(Claude Pepper)认识到计算机信息处理方法对生物医学研究的重要性,并发起了立法,于1988年11月4日建立了国家生物技术信息中心(NCBI),作为美国国立卫生研究院(NIH)国家医学图书馆(NLM)的一个部门。NLM之所以被选中,是因为其在创建和维护生物医学数据库方面的经验,并且因为作为NIH的一部分,它可以建立一个计算分子生物学的校内研究项目。

    基础研究

    NCBI的使命是开发新的信息技术,以帮助理解、控制健康和疾病的基本分子和遗传过程。更具体地说,NCBI负责创建自动化系统,用于存储和分析有关分子生物学、生物化学和遗传学的知识;促进研究和医学界使用此类数据库和软件;协调并收集国内和国际上的信息;研究基于计算机的先进信息处理方法,以分析具有重要生物学意义的分子的结构和功能。

    NCBI的多样化职责

    • 在分子水平上对基本生物医学问题进行研究;
    • 与多个 NIH 研究所、学术界、工业界和其他政府机构协作;
    • 通过赞助会议、研讨会和系列讲座来促进科学交流;
    • 通过美国国立卫生研究院校内研究项目,支持博士后研究员的计算生物学基础和应用研究培训;
    • 通过科学访问者计划,让国际科学界的成员参与信息学研究和培训;
    • 为科学和医学界开发、分发、支持和协调对各种数据库和软件;
    • 制定和推广数据库、数据储存和交换以及生物命名标准。

    组织架构

    计算生物学分支

    • 负责分子生物学和遗传学的计算,在数学和理论问题方面进行基础和应用研究,包括基因组分析、序列比较、序列搜索方法、大分子结构、动力学和相互作用以及结构/功能预测;
    • 与 NIH 校内实验室、其他政府机构、学术界和工业界的生物学家、化学家、数学家和计算机科学家建立基于计算的分子生物学合作研究项目;
    • 为政府机构和研究实验室提供咨询和建议,以应用基于计算机的分析工具来研究分子生物学;
    • 与分子生物学小组互动,通过应用计算和理论方法优化实验室过程和结果。

    资讯工程科

    • 在数据表示和分析方面进行应用研究,包括开发基于计算机的系统,用于存储、管理和检索与分子生物学、遗传学和生物化学相关的知识;
    • 设计数据库架构和规范,用于表示各种形式的分子生物学信息,包括核酸、蛋白质和结构信息。这些数据库属于国家资源;
    • 设计和开发从原型到运行阶段的分布式软件系统,为研究人员提供本地和远程计算服务;
    • 通过建立精心策划和集成的数据库,协调公众对序列、遗传学、结构和书目信息的访问,并在可能的情况下建立与外部数据库的联系;
    • 与美国国立卫生研究院校内实验室以及校外学术团体建立合作信息学研究项目;
    • 就软件和数据库设计的先进方法向其他政府机构和研究实验室提供咨询并提出建议;
    • 制定和推广数据库、数据交换和生物命名法的标准。

    资讯资源科

    • 计划、指导和管理 NCBI 的技术运营,包括用于研发的计算机系统以及用于访问公共数据库的计算机系统;
    • 为NCBI工作人员提供技术援助,并为NCBI网络服务的外部用户提供支持;
    • 监督 NCBI 的网络运营,并与其他政府机构协调,以便在国内和国际上获得 NCBI 服务;
    • 为生物医学界举办教育示范和研讨会,以促进使用NCBI的信息服务;
    • 规划、开发和管理政府合同和合作协议,采购设备和服务,支持NCBI信息功能;
    • 为参与基因组项目的机构提供支持服务;
    • 进行应用研究和开发,提供技术咨询和指导,并确定用户需求。进行调查以评估 NCBI 开发的软件在生物学用户社区中的使用情况;
    • 与其他政府机构和生物学信息资源协调,以促进 NCBI 数据存储库的开发。

    科学顾问委员会每年召开两次会议,审查中心的计划和研究活动。

    NCBI navigation【Home Page】【Mission】【Organization

  • Illumina测序化学原理

    Illumina一词来自于拉丁语,意思是发光、照亮。让人很容易联想到一个发光的灯泡,体现了该公司对创新的重视。Illumina公司的芯片通常只有载玻片的大小,每个芯片上有一个装置,叫做流动池(Flowcell),流动池分成8个泳道(Lanes),也就是可以并行做8个处理。每个泳道内利用共价键固定着两种DNA,用于和特定的接头配对。

    文库的建立

    构建DNA文库首先需要把基因组DNA用超声波打断,之后把两端用酶补平。再用Klenow酶在3’端加上一个A碱基,然后再用连接酶把接头连上去。

    桥式PCR

    两头都加了接头的碱基片段被大批量放入泳道,芯片上的与接头互补的引物会与接头杂交。再加入连接酶和dNTP,可生成新链。新链生成完毕,洗掉没有共价键保护的文库链,那么,新生成的反义链的另一端接头会与泳道上的另一个接头互补杂交,形成单链桥。

    单链桥再次放入DNA连接酶和dNTP,则又会互补出一条链。两条链都被共价键固定在泳道上,再次打开氢键,则获得正反链。

    重复上面的过程,正反义链会分别再与临近的接头互补杂交,形成非常多的桥,数量呈指数倍增加。

    接下来,用酶洗掉反义链,只保留正义链,将引物结合到共价键固定的对立端,并放入特殊处理的dNTP。这种dNTP的3位置羟基被叠氮基覆盖,并连接有一个能代表特定核苷酸的荧光染料。由于3’端羟基没有裸露,不能形成链,反应终止。因此,可以根据荧光确定该碱基是A、T、C、G的哪一种。接下来,洗掉叠氮基及其连着的荧光燃料,令3’端的羟基露出,再加入处理过的dNTP,得到一个新碱基的荧光。以此类推。

    Barcode

    每个生物学重复或不同样本是可以放在同一个泳道内进行测定的,但是需要区分每一个文库的片段是来自哪个样本。因此,街头上往往会增加一个barcode,这样,当测序时发现了特别的barcode序列,则可以断定该序列属于哪个样本。

    双端测序

    反过来,再对反义链进行测序,即把正义链的序列切除,其余工作与正义链的测序方法一致。这样,就可以把从正、反两端开始测序,把测序长度提高了一倍(sanger测序一般是800~1000bp),也提高了准确性和可靠性。

    视频学习链接】以上信息总结自《陈巍学基因》系列视频。