Pooling Sequencing

news2025/1/11 18:29:57

1、混合(Pooling)样本测序研究

https://www.jianshu.com/p/19ce438ccccf

1.1 混合测序基础

测序成本虽然下降了,但对于植物育种应用研究来说还是很高,动不动就上百群体,小小植物个体价值又低,测完了很可能后面就用不到了。这时,混合样本测序是一种省钱的好办法。

混池测序(Pool-seq)相对于GWAS或其他精细定位策略而言,其实是一个初定位产品,其结果很有可能是跟性状相关的候选区域。

概念:
混合样本测序一般是选择表型极端或目标性状差异的个体混合,构建一个文库进行测序。

原理:
假设每个样本被测到的概率相等,通过测序reads数计算等位基因频率。如果基因与研究性状有关,那么理想情况下,表型差异显著的混合样本中,该基因等位基因频率差异显著。

在这里插入图片描述

不足:

  • 大群体的等位基因频率才能代表该群体真实的情况,选择少量样本可能带来选样误差;
  • 各样本测序量不均一引入新的偏差。
    但研究表明,在大样本量混合且提高测序深度的情况下,混合样本能够准确评估等位基因频率。

影响因素及建议:

  • 群体类型:群体类型决定研究背景是否纯,影响定位的精确性。混合样本测序最好是只有目标性状存在差异,其他性状一致,即遗传背景纯,一般永久群体>临时群体>自然群体。

  • 混合样本量:多态性高的群体(如F2),推荐混合样本量>100;多态性低的群体(如BCF),推荐混合样本量>20;且作图群体选择比例<25%。

  • 亲本选择:两个亲本尽量性状差异单一,杂合位点少。

  • 混合样本的均一性:样本量小的时候影响大,样本量大影响小。

  • 表型:表型统计不准确,或由多个微效基因控制,会引起定位效果不佳。

  • 参考基因组:基因组组装好坏,基因组注释情况,物种连锁不平衡强易导致候选区域过大。建议采用组装到染色体水平的参考基因组。

  • 测序错误:混合样本测序比较难通过算法区分是测序错误还是稀有变异,测序深度高能有效降低影响。

  • 测序数据量:测序数据量推荐50X以上,测序深度高有利于检测到多态的SNP位点。

  • 比对:混合样本无法校正比对错误,CNV会影响等位基因频率统计。

1.2 点突变检测

对于隐形纯合点突变,效果较好。

在这里插入图片描述

MutMap和MutMap+是利用SNP-index算法,需要参考基因组,如果目标位点位于参考基因组没有组装上的gap区,或是参考基因组不具有的序列中,利用MutMap检测方法就不能有效检测到目标突变位点。

MutMap-Gap方法结合了MutMap和de novo组装。先通过MutMap分析SNP-index peak区,发现找不到跟突变性状相关的基因,再将之前比对不上参考基因组的野生型亲本unmapped reads和MutMap分析中SNP-index peak区域的野生型亲本比对上的reads一起进行de novo组装,获得潜在的新基因,并以此为参考再计算SNP-index,检测目标突变位点。

1.3 BSA

BSA(Bulked segregant analysis,混合分组分析),利用目标性状存在极端表型差异的两个亲本构建分离群体,在子代分离群体中,选取两组表型差异极端的个体分别构建混合池 ,结合高通量测序技术对混合样本测序,比较两组群体在多态位点(SNP)的等位基因频率(AF)是否具有显著差异,定位与目标性状相关联的位点并对其进行注释,研究控制目标性状的基因及其分子机制。

SNP-index是主流的BSA定位算法。其原理是构建子代分离群体,经过挑选极端性状构建混池后对SNP进行检测,对各混池进行等位基因频率分析,并与其中一个亲本进行比较。与此亲本不同的基因型所占的比例,即为该位点的SNP-index。

在这里插入图片描述

注意这里的reference并不是变异检测的参考基因组,而是构建群体所使用的亲本,所以SNP-index计算高度依赖于亲本测序数据。)

两个混池相减(上图右)得到了△SNP-index的结果,即两个混池之间SNP基因型频率的差异。理论上说,不与性状相关的位点,△SNP-index的值应当在0左右,代表混池之间不存在差异;而QTL及其相连锁位置的SNP,△SNP-index值应当呈现较高的数值。

△SNP index会存在因统计偏差造成的假阳性位点,可以通过计算滑窗内所有SNP的△SNP-index,来消除其影响,得到真正QTL所在的基因组区域。

其他算法如欧几里得距离(ED),Gradedpool-seq(Ridit检验)等。

这里的BSA是指狭义上的QTL-seq,针对有主效基因的数量性状。实际上上面的质量性状/点突变性状、InDel-seq(InDel突变性状)以及下面的BSR,都属于BSA的范畴,原理相似。此外还有QTG-seq。相应的Pipeline可参考:http://genome-e.ibrc.or.jp/home/bioinformatics-team/mutmap

1.4 BSR

BSR(Bulked segregant RNA sequencing)同样依据分组混合的原理,在RNA水平上进行高通量测序并定位候选基因,即BSA+RNAseq。BSR的混池同样选取分离群体中的极端性状单株,混池用的单株数会比BSA多一些(大多大于30),提取RNA进行混池,再进行转录组测序,mapping参考基因组后同样进行变异分析,确定候选区间。BSR的优势在于不仅提供变异信息,还能提供候选区域中基因的表达信息。

BSR的劣势:RNAseq只能检测表达基因上的SNP,检测的SNP数量少,一般只适用于高频的SNP。同时由于存在RNA编辑等问题,RNA层面检测的SNP和DNA层面也是有差别的,所以只有当DNA层面无法实现(复杂基因组)或DNA测序成本过高(超大基因组)等情况下可选择BSR,否则还是优先选择BSA。

1.5 混合样本GWAS分析

Pool –GWAS也是一种省钱策略,但还是非常小众。
比如:GWAS study using DNA pooling strategy identifies association of variant rs4910623 in OR52B4 gene with anti-VEGF treatment response in age-related macular degeneration

Pool –GWAS研究复杂遗传背景的性状功效降低,对稀有变异的检测能力下降。

1.6. 混合样本驯化研究

同样,分析获得的驯化相关位点很多,如果想用类似的方法检测复杂性状相关位点,后续挖掘真正的功能位点的难度还是很大。

1.7. 小结

在这里插入图片描述

2. BSA专题——分析方法大汇总 【派森诺】

https://www.sohu.com/a/414749205_120380672

在农业科学中,为了提升作物农艺性状,经常会遇到将与性状相关的基因或位点在基因组上进行定位的需求,此时BSA作为一种简便又高效的分析方法便有了大显身手的机会。可是BSA究竟是怎样的一种研究方法呢,适用于什么群体呢?跟着小编了解一下吧!

2.1 什么是BSA?

BSA(Bulked segregation analysis)即混合分组分析,也称分离群体分组分析,是指利用目标性状存在极端表型差异的两个亲本构建分离群体,在子代分离群体中,选取两组表型差异极端的个体分别构建混合池 ,结合高通量测序技术对混合样本测序,比较两组群体在多态位点(SNP)的等位基因频率(AF)是否具有显著差异,定位与目标性状相关联的位点并对其进行注释,研究控制目标性状的基因及其分子机制。

相较于传统的遗传学研究方法(基因定位常用分析方法,小编已经安排上啦!),BSA最大的特点是不需要对群体中的所有个体进行基因分型,而是对挑选的个体按照性状进行混合分析,所以可以极大地降低研究的工作量和成本。

2.2 什么样本适合BSA分析?

既然BSA已经兼具了简便,准确、高性价比等优点,自然也有自己的小性子了,BSA分析对使用的群体有一定要求。

1、 人工构建的遗传群体(最常用来的是F2、BC、RIL)。通常来说,使用自然群体和遗传群体都可以进行BSA分析,但是考虑到遗传背景较复杂,可能导致定位结果不理想,所以不推荐使用自然群体进行BSA研究。

2、 亲本目标性状差异明显,其他性状差异随机分布,所构建分离群体两个混池之间目标性状有显著差异,非目标性状无明显差异。

3、 有合适的参考基因组信息。参考基因组组装的越好,信息越全,对于后续基因定位和候选区间的注释都会更加精确,可以锁定候选区间并估计候选区域的大小。没有组装到染色体级别的参考基因组,分析思路是一样的,但只能得到某个或某些scaffolds中的snp与性状相关,无法估计候选区间大小,甚至再组装结果差的情况下,无法判断基因的物理位置。

2.3 BSA有哪些分析方法?

1、SNP index及△SNP index

SNP-index作为主流的BSA定位的算法,最早在2013年被提出(Takagi)。它的基本原理是,构建子代分离群体,经过挑选极端性状构建混池后对SNP进行检测,对各混池进行等位基因频率分析,并与其中一个亲本进行比较。与此亲本不同的基因型所占的比例,即为该位点的SNP-index。从下图可以看到,两个位点的SNP-index分别为0.4和1。值得注意的是,这里的reference指的并不是我们进行重测序变异检测的参考基因组,而是我们构建群体所使用的亲本。这也是为什么进行SNP-index计算必须依赖于亲本测序数据的缘故。
在这里插入图片描述

每个混池都得到一组SNP-index数据之后,两个混池相减(上图右),即得到了△SNP-index的结果,代表的是两个混池之间SNP基因型频率的差异。理论上说,不与性状相关的位点,△SNP-index的值应当在0左右,代表混池之间不存在差异;而QTL及其相连锁位置的SNP,△SNP-index值应当呈现较高的数值。△SNP index这种分析方法会存在因统计偏差造成的假阳性位点,这时我们可以通过计算滑窗内所有SNP的△SNP-index,来消除其影响,得到真正QTL所在的基因组区域。

2、 欧几里得距离(ED)

在这里插入图片描述

随着BSA技术的发展,SNP-index显示出了一定的局限性,比如亲本数据缺失,林木类较难构建分析群体,ED值的分析方法应运而生。在BSA和BSR中,欧几里得距离可以计算同一个位点上,两个混池之间的等位基因频率。两个极端性状子代混池只在控制性状的QTL及其连锁位点出现差异,所以通过各个位点欧几里得距离的计算,我们可以判断哪些位点更可能是控制对应性状的QTL。计算公式如下:

在这里插入图片描述

实际应用中,我们在BSA的两组混池之间可能会得到数十万甚至上百万个SNP,有的SNP可能实际与性状无关,但因为抽样偏差,导致计算得到的ED值很高,为了排除统计异常值,我们通常会采用滑窗对在一个窗口内所有位点的ED值进行拟合,消除抽样偏差产生的假阳性结果。而在BSA定位区间计算过程中,会对ED值采取乘方处理,放大ED值的差异,使定位区间更加明显。

3、 Gradedpool-seq(Ridit检验)

Gradedpool-seq的概念在2019年由韩斌和黄学辉课题组提出并发表于Nature Communication(Wang et al., 2019)。这种方法与常规BSA类似的是,它也是基于性状分离群体中按照性状选择子代个体构成混池(通常加上亲本)进行测序,并进行QTL定位的方式。Ridit是relative to an identified distribution unit一词的缩写,它是一种非参数检验分析方法,用于按等级分组资料的比较。而对于多个混池测序数据,Ridit检验会对每个位点的等位基因频率进行计算,判断其是否显著偏离标准分布,得到一个p值。换言之,这个位点的p值越小,即代表这个位点与性状相关联的可能性越高(与GWAS关联方法类似)。

在这里插入图片描述

由于在BSA项目中Ridit检验的对象只有2-4个混池,基因型数据较少,所以当Ridit检验的结果用曼哈顿图的形式展现出来,其噪音非常强烈,很难从中直观地判断我们的候选区间的位置。研究者们选取一定大小的窗口,并且将窗口内的SNP位点进行统计,计算p值低于阈值的位点所占的比例。一般经过这种

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1713767.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

qemu使用简介

安装qemu git clone https://github.com/qemu/qemu.git mkdir build cd build ../configure make -j16 make install 编译内核 wget https://mirror.bjtu.edu.cn/kernel/linux/kernel/v5.x/linux-5.10.tar.xz tar -xf linux-5.10.tar.xzsudo apt-get install gcc-arm-linux-g…

小白跟做江科大32单片机之蜂鸣器

1.复制之前编写的工程库项目&#xff0c;详细工程库创建过程如下链接&#xff1a; 小白跟做江科大32单片机之LED闪烁-CSDN博客https://blog.csdn.net/weixin_58051657/article/details/139295351?spm1001.2014.3001.55022.按照江科大老师给的图片进行连接蜂鸣器 3.修改main.c…

不同 Android Studio 版本的 SDK 及 NDK 选择

从 2020 年开始&#xff0c;Android Studio 每年都升级 3 个版本&#xff0c;某些版本甚至有 Patch&#xff0c;对于这些新的版本更新&#xff0c;还是很有必要的&#xff1a; 1. 新功能和改进&#xff1a;不同版本的 Android Studio 会引入新的功能和改进&#xff0c;例如性能…

高精度3D Hall摇杆专用芯片,开启操控新纪元!

昆泰芯正式推出全新一代3D Hall摇杆专用芯片——【KTH577X】&#xff01;这款芯片将为您的操控设备带来前所未有的精准度和响应速度。 产品亮点 一.超高精度&#xff1a;采用最新的3D Hall效应技术&#xff0c;提供16位磁场分辨率&#xff0c;确保每一次操控都精确无误。 二.低…

STL:string

文章目录 标准库中的string类string的构造string的赋值重载string的容量size(length)max_sizeresizereservecapacityclearemptyshink_to_fit string的元素访问operator[] 和 atfront 和 back string的迭代器 和 范围forstring的修改operatorappendpush_backassigninserterasere…

怎么看qq注册时间?你的qq生日居然是这样查看的!

QQ账号就像是一个穿越时空的日记本&#xff0c;每一个聊天记录、每一条动态都是时间的印记。而QQ注册时间&#xff0c;便是这本日记本的开篇第一章&#xff0c;它见证了你的网络生活的起点。怎么看qq注册时间呢&#xff1f;别着急&#xff0c;接下来我将为你揭晓答案。 操作环境…

小白windows系统从零开始本地部署大模型全记录

大家好&#xff0c;最近两年大语言模型风靡全球&#xff0c;最近&#xff0c;不少开源大模型&#xff0c;将模型部署到自己的电脑上&#xff0c;用个性化的数据微调想必是不少人的愿望&#xff0c;这次&#xff0c;让我来分享从hugging face上下载部署chatglm3-6b中的经验。 1.…

2024年PMP考试备考需要多长时间,每天学习多长时间?

这取决于您在PMP上投入的时间和效率&#xff0c;通常情况下&#xff0c;2-3个月就够了。如果您平时工作很忙&#xff0c;每天可以挤出一个小时来学习&#xff1b;如果时间比较充裕&#xff0c;可以花两个小时看书、做题和参加直播课。在备考之前&#xff0c;要先了解PMP每年的考…

被忽视的模块化领域:聚合、结算与执行层

原文标题&#xff1a;《Aggregation, settlement, execution》撰文&#xff1a;Bridget Harris 编译&#xff1a;Chris&#xff0c;Techub News 在关注度和创新方面&#xff0c;模块化堆栈的各个部分并不一样&#xff0c;虽然之前有许多项目在数据可用性&#xff08;DA&#xf…

【目标解算】相机内外参数详细解读+坐标系转换

一、相机参数介绍 1.1 相机内参矩阵 概念&#xff1a;内参矩阵用于描述相机的内部参数&#xff0c;它包含了相机的焦距、主点坐标和图像的畸变等信息。内参矩阵的形式通常为一个3x3的矩阵&#xff0c;常用表示为K。内参矩阵可以将相机坐标系中的三维点映射到图像平面上的二维…

怎么更改图片格式?图片在线转格式的使用方法

现在很多的平台在上传图片的时候&#xff0c;都会有规定要求的大小、格式、尺寸&#xff0c;只有符合要求的图片才可以正常上传。在网上传图时想要快速的修改图片格式&#xff0c;比较简单的一个方法就是在使用在线图片格式转换的工具就能够快速处理&#xff0c;下面将图片转格…

HackTheBox-Machines--Lazy

Lazy测试过程 1 信息收集 1.端口扫描 发现 SSH&#xff08;22&#xff09;、HTTP&#xff08;80&#xff09;端口 nmap -sC -sV 10.129.159.512.访问 80 端口 1.页面中存在注册功能&#xff0c;测试注册功能 页面返回登录页面及用户名 使用burpsuite观察注册请求 /register.p…

Vue使用axios实现调用后端接口

准备后端接口 首先&#xff0c;我已经写好一个后端接口用来返回我的用户数据&#xff0c;并用Postman测试成功如下&#xff1a; 以我的接口为例&#xff0c;接口地址为&#xff1a;http://localhost:8080/user/selectAll 返回Json为&#xff1a; {"code": "2…

通过AWR结合SQLHC对性能变低的SQL进行分析的过程

ESTDB数据库2020/4/29下午16点附近出现业务卡顿现象。 可以发现问题SQL为(SQL_ID fr0nhywcycrsa)。占问题时段数据库资源消耗的52.69%&#xff0c;通过对此SQL语句的执行效率进行分析&#xff0c;我们发现&#xff1a; 对SQL_ID fr0nhywcycrsa?进行分析&#xff0c;可以发现此…

精通推荐算法8:Embedding表征学习 -- 总体架构

1 Embedding表征学习的总体架构 目前&#xff0c;推荐算法精排模型大多基于Embedding MLP范式&#xff0c;模型底层是Embedding层&#xff0c;作用是将高维稀疏的输入特征转换为低维稠密的特征向量&#xff0c;并实现一定的模糊查找能力。模型上层是MLP层&#xff0c;作用是对…

鸿蒙应用模型:【Ability Kit】简介

Ability Kit简介 Ability Kit&#xff08;程序框架服务&#xff09;提供了应用程序开发和运行的应用模型&#xff0c;是系统为开发者提供的应用程序所需能力的抽象提炼&#xff0c;它提供了应用程序必备的组件和运行机制。有了应用模型&#xff0c;开发者可以基于一套统一的模…

了解可燃气体报警器的检测原理与注意事项

在工业、商业以及家庭生活中&#xff0c;可燃气体报警器作为安全监测的重要设备&#xff0c;发挥着不可忽视的作用。 那么&#xff0c;可燃气体报警器主要检测哪些气体呢&#xff1f; 接下来&#xff0c;佰德将从可燃气体种类、报警器工作原理、检测范围与精度、应用场景与重…

Linux_应用篇(11) 线程

上一章&#xff0c;学习了进程相关的知识内容&#xff0c; 对进程有了一个比较全面的认识和理解&#xff1b; 本章开始&#xff0c; 将学习 Linux应用编程中非常重要的编程技巧---线程&#xff08;Thread&#xff09; &#xff1b;与进程类似&#xff0c;线程是允许应用程序并发…

计算机电子书籍资源转载分享

这篇会很简略&#xff0c;一个博主的宝藏&#xff0c;被我发现了&#xff0c;而且是去年2023年更新的&#xff0c;里面计算机网络的第八版书籍都有&#xff08;谢希仁编著&#xff09; 这是该博主的github上面发布的&#xff1a;zhangyachen/ComputerArchitectureAndCppBooks:…

轻松解决msvcp140_ATOMIC_WAIT.dll丢失问题的5种方法

在电脑使用过程中&#xff0c;我们经常会遇到一些错误提示&#xff0c;其中之一就是“msvcp140_ATOMIC_WAIT.dll丢失”。这个错误提示通常出现在运行某些程序或游戏时&#xff0c;给使用者带来了很大的困扰。那么&#xff0c;如何解决这个问题呢&#xff1f;小编将为大家介绍5种…