GPB | RegVar:基于深度神经网络的非编码区突变功能预测新方法

news2024/11/18 9:24:59

fcdfad754a4ae5d87bc97338abe7c82a.png

Genomics, Proteomics & Bioinformatics (GPB)发表了由军事医学研究院辐射医学研究所张成岗研究员周钢桥研究员卢一鸣副研究员团队完成的题为“RegVar: Tissue-specific Prioritization of Noncoding Regulatory Variants”的方法文章。我们的“要文译荐”栏目很高兴邀请到文章的通讯作者张成岗研究员为大家介绍RegVar方法的建立与应用。

要点介绍

研究问题:

基于全基因组测序的研究工作,研究人员已在人类基因组上发现了超过8000万个基因突变位点,在单个个体基因组上也存在400~500万个突变位点。如何对这些海量突变位点在个体疾病与性状产生过程中的作用进行系统研究,仍然是基因组学与遗传学领域的一大难题。此外,由于基因组上绝大部分突变位于非编码区,可通过影响基因转录和翻译过程中的不同生物事件来发挥作用,对其进行准确的功能注释和靶基因鉴定仍是一重大挑战。

研究方法:

利用来自基因型-组织表达(genotype-tissue expression, GTEx)研究项目的组织类型特异性表达数量性状基因座(expression quantitative trait loci, eQTL)数据,采用深度神经网络(deep neural network, DNN)的计算框架,对发挥调控功能的SNP位点与其靶基因位点的多种分子特征进行整合建模分析,包括其序列特征、表观组学特征和进化保守性特征等,在17种人体组织中构建了组织特异性的非编码区调控型突变预测模型,并在多种条件下对模型的预测性能进行了充分评估。

主要结果:

我们建立了一种基于DNN的计算框架RegVar,它可以准确预测非编码区调控型突变的组织特异性调控功能,并对其靶基因进行高准确性鉴定。通过学习多种人类组织中“遗传位点-基因表达”关联的分子特征,RegVar在多种情景下表现出对非编码区调控型突变功能预测的优异性能。我们期待RegVar能够帮助深入理解人类基因组的遗传结构,并有助于揭示复杂性状和疾病背后新的分子机制。

背景和研究对象

来自全基因组关联分析(genome-wide association studies, GWAS)的研究结果显示,大量变异位点与疾病表型之间存在显著关联,其中绝大部分位于基因组的非编码区。非编码区的变异位点不改变编码蛋白的序列和功能,主要通过调控基因的表达来发挥效应。如何对这些具有调控功能的变异位点进行鉴定和注释是医学遗传学研究中的一大挑战。

以往针对非编码区突变效应的研究大多关注于致病型突变的注释,对这些方法的评测结果显示其并不适用于调控型突变的鉴定。与致病型突变相比,调控型突变的突变效应更为微弱,使得其鉴定更加困难。调控元件与其调控的靶基因之间通常具有较远的基因组距离,如何在远距离上将调控元件上的变异位点与靶基因联系起来,是本领域的研究难点。此外,调控型突变的作用往往具有组织或细胞类型特异性,对不同组织类型中的变异位点进行特异性注释,也具有十分重要的生物学意义。

方法建立

RegVar采用DNN算法框架,利用来自GTEx研究项目的eQTL数据进行建模分析,结合了突变位点及其所调控的靶基因的序列、表观组学和进化保守性等特征,在17种人体组织中构建了组织特异性的非编码区调控型突变预测模型。为了对方法的稳健性与有效性进行充分评估,构建了多种情景下的阴性数据集对RegVar的预测性能进行测试,包括:(1)随机突变组,即选择基因组上随机阴性SNP位点与靶基因构成阴性数据集;(2)镜像突变组,即选择基因组上与阳性突变位点关于靶基因镜像对称位置的阴性SNP位点与靶基因构成阴性数据集;(3)邻近突变组,即选择基因组上阳性突变位点附近的阴性SNP位点与靶基因构成阴性数据集;(4)随机基因组,即选择基因组上阳性突变位点1Mb之内的随机基因与阳性突变构成阴性数据集。对这些条件下的阴性数据集进行预测评估,发现RegVar均表现出良好的预测性能,说明RegVar具有较好的稳健性与有效性(图1)。与以往方法相比,RegVar也表现出更高的预测准确性。

e36a26566c5a420ae81b1ce65227e75f.jpeg

图1  在不同条件下RegVar与已有方法在肝脏eQTL数据上的预测表现

RegVar应用性分析

在可应用性方面,采用RegVar对22号常染色体上所有SNP位点进行了调控概率的注释,结果显示其中存在大量具有高调控功能概率的变异位点,可能影响到特定靶基因的表达(图2)。在真实的eQTL研究中,这些位点并不能被成功检测出来,可能是由于这些位点的调控效应十分微弱而导致的,此外也可能受到样本量与统计效力等限制因素的影响。

be8c38c52ebec6c15c97e624f4c824f3.jpeg

图2  RegVar对22号常染色体上SNP位点进行调控概率预测

随后,使用RegVar模型对全基因组中随机选取的变异位点进行了组织特异性预测分析,鉴定到跨组织与组织特异性调控型突变位点(图3)。对其进行表观特征注释,结果显示,跨组织调控型突变位点往往带有多个组织的启动子表观修饰,而组织特异性调控型突变位点则大多带有组织特异性的增强子表观修饰(图3)。

d3427dfb5ede48505d9ccb4830ada8e0.jpeg

图3  RegVar在全基因组上鉴定跨组织与组织特异性调控型突变位点

为了进一步探究RegVar模型的可拓展性,利用人类基因突变数据库(human gene mutation database, HGMD)中的致病型突变位点信息,利用相似的研究框架构建了致病型突变预测模型。与已发表的同类方法相比,RegVar可达到同等程度的预测性能。RegVar同时提供了可在线访问的网页应用(https://regvar.omic.tech/)和可下载的模型程序包供相关领域的研究者使用和参考。

222c0378970fb154b13c9cbe2bf33ff9.png

扫描二维码获取链接

总结和讨论

非编码区突变能够通过多种复杂机制在许多疾病和复杂性状产生过程中发挥重要作用,然而如何将非编码区突变,尤其是长距离突变,与其靶基因联系起来一直是一个巨大挑战。目前已经有研究者开发了许多方法对非编码区突变进行功能注释,尽管这些方法在基本假设和具体算法框架上各不相同,但它们主要关注于致病型突变作用。因此,大量具有微弱调节作用的突变将被忽视。我们展示了RegVar在不同情景下对调控型突变进行功能预测的优异性能,RegVar有望应用于候选突变位点的筛选、靶基因的鉴定等研究中,为揭示基因组中复杂的调控关系以及阐明复杂性状的分子成因提供帮助。

审校人:

GPB青年编委侯娅丽

文章编译来源:

Lu H, Ma L, Quan C, Li L, Lu Y, Zhou G, Zhang C. RegVar: Tissue-specific Prioritization of Noncoding Regulatory Variants. Genomics Proteomics Bioinformatics 2023;21(2):385-395. 

英文全文详见:

https://www.sciencedirect.com/science/article/pii/S1672022921002564

作者资助信息:

军事科学院军事医学研究院辐射医学研究所张成岗研究员周钢桥研究员卢一鸣副研究员为论文的共同通讯作者,该所的路浩助理研究员为论文的第一作者,马露雨权诚李磊为文章共同作者。该研究得到了国家自然科学基金、北京市科技新星计划的资助。

GPB论文:

RegVar: Tissue-specific Prioritization of Noncoding Regulatory Variants

长按并识别二维码,阅读原文

0d2d8d1f9432680bffc382f92772c06e.png

97edc70b40fe26c9e67d6f12e55a8056.png

     相关推荐     

GPB | CARMEN:基因表达调控相关非编码变异的精准功能预测算法

GPB | NetGO 3.0: 蛋白语言大模型有效提升蛋白质功能预测性能

GPB | GREPore-seq:通过长片段PCR和纳米孔测序高效检测基因编辑后突变的实验流程

   About GPB   

Genomics, Proteomics & Bioinformatics(基因组蛋白质组与生物信息学报,简称GPB)于2003年创刊,是由中国科学院主管、中国科学院北京基因组研究所(国家生物信息中心)与中国遗传学会共同主办的英文学术期刊,由牛津大学出版社金色开放获取(Gold Open Access)出版。刊载来自世界范围内组学、生物信息学及相关领域的优质稿件。现为中国科学引文数据库(CSCD)和中国科技论文与引文数据库(CSTPCD)核心期刊,被SCIE、PubMed/MEDLINE、Scopus等数据库收录。2023年公布的官方数据显示,CiteScore为11.7;2年和5年Impact Factor分别为9.5和10.1,分别排名WoS遗传学领域12/171和13/171;2022 JCI为2.08,排名WoS遗传学领域10/189。期刊由科技部等七部门联合实施的“中国科技期刊卓越行动计划“资助(2019–2023)。

高颜值免费 SCI 在线绘图(点击图片直达)

7aa93e641da47ad070832f2522b103c0.png

最全植物基因组数据库IMP (点击图片直达)

039899faa0c742f0b5067bbbc6262c9a.png

往期精品(点击图片直达文字对应教程)

ac7c826828c2457cc76ab0d594ca6213.jpeg

237ef6b61dee6dbbf028e03f008d6b6d.jpeg

d7087f423a71c7998ef382ca30756a3a.jpeg

6b303feb01902cf9b29c65590f3b35d3.jpeg

c0f9bffe5e87cd1747cbd79b49917a90.jpeg

57870c4f4f44d4493f607541213ff775.jpeg

a4ccffbbfbf477519b2ae4e55f2acb29.jpeg

0ad3737513b0516bcb3bf9dacfe1ca83.jpeg

4692884a59cefd8d19d67f8cef5e5599.jpeg

833b176a1faf81328a0116aee7ffbcce.jpeg

f52b7ef475cba95e5805174534186317.jpeg

7a5ea94f72dcdabbef67187dc01312d5.jpeg

7a8da0faf00cc63a842bed2890633971.png

64e2622433b30462763e0bdf3cbfc6c6.png

29877e1d03bc2db8a827bf5812dff3f4.png

ebe327c91d65063ae37abbb3dc88a2b8.png

da6ba79cd3c8a701512757a06edfb334.jpeg

fb54a88df76387b366320712b6c453a9.jpeg

590b2d63ac3b152bbafbffd71e2aaa28.jpeg

69d5a9cded79c59e4d2f5e7a79c9dd69.jpeg

c1c55a610fbbde6eb2cf5d11d150273d.png

7b31f8d0c5173e8f5acb31b75ab14ec1.png

3cace33fef0e7d123f6b75ab16a27455.jpeg

2252962a368a4694b6f0200e50820077.png

571c38b5caed88a3001c45a4e8074e25.png

10d746eefac37af09ab2c2448f7f0b63.jpeg

205064660d0a9bac6979ab766bbf2f4d.png

415f06f6e39310f30fe07b704e001adc.png

机器学习

605c74eb2f1103e3929f6d8cf2436fb4.jpeg

49177c2edb9dbef4b55703138758551e.jpeg

204c2baed2a886beb5d4d872936612da.png

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1625023.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

Linux常用监控命令(笔试面试常考)

1.、free命令 [rootRocky8-node1 ~]# free -htotal used free shared buff/cache available Mem: 1.7Gi 1.1Gi 69Mi 31Mi 554Mi 436Mi Swap: 2.0Gi 258Mi 1.7Gi free命令是Linux系统中用…

paddle ocr v4 微调训练文字识别模型实践

识别步骤参考:https://github.com/PaddlePaddle/PaddleOCR/blob/main/doc/doc_ch/recognition.md 微调步骤参考:https://github.com/PaddlePaddle/PaddleOCR/blob/release/2.7.1/doc/doc_ch/finetune.md 训练必要性 原始模型标点符号和括号容易识别不到 数据准备…

【C++】---STL之list的模拟实现

【C】---STL之list的模拟实现 一、list模拟实现思路二、结点类的实现三、list迭代器的实现1、ListIterator类2、构造函数3、operator*运算符重载5、operator->运算符重载6、operator!运算符重载7、operator运算符重载8、前置9、后置10、前置--11、后置-- 四、lis…

JavaScript云LIS系统概述 前端框架JQuery+EasyUI+Bootstrap医院云HIS系统源码 开箱即用

云LIS系统概述JavaScript前端框架JQueryEasyUIBootstrap医院云HIS系统源码 开箱即用 云LIS(云实验室信息管理系统)是一种结合了计算机网络化信息系统的技术,它无缝嵌入到云HIS(医院信息系统)中,用于连…

uniapp H5实现签名

第一种&#xff1a;跳转签名页面 1、创建审核页面audit.vue <template><view><uni-section title""><view class"auditClass"><uni-forms :model"baseFormData" ref"baseFormRef" :rules"rules&quo…

Docker镜像的创建 和 Dockerfile

一. Docker 镜像的创建 创建镜像有三种方法&#xff0c;分别为基于已有镜像创建、基于本地模板创建以及基于 Dockerfile 创建。 1 基于现有镜像创建 &#xff08;1&#xff09;首先启动一个镜像&#xff0c;在容器里做修改docker run -it --name web3 centos:7 /bin/bash …

第12章 最佳的UI体验——Material Design实战

第12章 最佳的UI体验——Material Design实战 其实长久以来&#xff0c;大多数人都认为Android系统的UI并不算美观&#xff0c;至少没有iOS系统的美观。以至于很多IT公司在进行应用界面设计的时候&#xff0c;为了保证双平台的统一性&#xff0c;强制要求Android端的界面风格必…

区块链技术与应用学习笔记(8-9节)——北大肖臻课程

目录 8.挖矿 对于全节点和轻节点思考问题&#xff1f; ①全节点在比特币的主要作用&#xff1f; ②挖矿时当监听到别人已经挖出区块并且延申了最长合法链此时应该立刻放弃当前区块在 本地重新组装一个指向最后这个新合法区块的候选区块&#xff0c;重新开始挖矿。节点这么做…

AbstractRoutingDataSource实现多数据源切换以及事务中无法切换问题

一、AbstractRoutingDataSource实现多数据源切换 为了实现数据源的动态切换&#xff0c;我们采用了AbstractRoutingDataSource结合AOP反射来自定义注解。通过这种机制&#xff0c;我们可以在运行时根据自定义注解来选择不同的数据源&#xff0c;从而实现灵活高效的数据访问策略…

Linux文件/目录高级管理一(头歌实训)

目录 任务描述 相关知识 Linux修改文件权限命令 Linux修改所有者权限 Linux修改同组用户权限 Linux修改其他用户权限 编程要求 任务描述 相关知识 Linux修改目录权限命令 Linux修改所有者权限 Linux修改同组用户权限 Linux修改其他用户权限 编程要求 任务描述 相…

Linux(Centos)服务器探索ffmpeg笔记 (命令行、Nvidia硬件加速、GPU、CPU、CUDA、h264_nvenc、过滤器、加水印)

目录 前言内容简介为什么会有这篇文章 1、服务器上怎么使用ffmpeg1.1 使用编译好的&#xff08;需要root权限&#xff09;1.2 自己怎么编译&#xff08;需要root权限&#xff09; 2 、非Root用户要怎么安装和使用3、ffmpeg命令的一些使用引导和参数介绍3.1 编译参数3.2 查询支持…

labview中TDMS读写波形图

TDMS与二进制读写速度区别不大&#xff0c;但是它具备关系型数据库的一些优点&#xff0c;经常用于存取波形数据。

数据库工程师的工作职责(合集)

数据库工程师的工作职责1 职责&#xff1a; 1. 日常数据库的基本安装&#xff0c;维护&#xff0c;升级&#xff0c;监控的; 2. 配合研发部门进行数据库设计支持&#xff0c;协助开发、设计和进行SQL语言优化; 3. 配合相关部门数据库相关的任务&#xff0c;比如数据导入导出&am…

单片机LCD1602显示电子时钟设计,含汇编程序、仿真、论文

目录 1、摘要 2 系统方案 2.1 系统整体方案的论证 3 硬件设计与实现 3.1单片机最小系统 3.2振荡电路的工作原理 3.2时钟电路的工作原理 3.3单片机最小系统电路图 3.4 时钟芯片 3.5 液晶显示电路 4 实物调试及测试 4.1 实物图 4.2仿真结果图如下所示 5、单片机源…

JAVA实现easyExcel动态生成excel

添加pom依赖 <dependency><groupId>com.alibaba</groupId><artifactId>easyexcel</artifactId><version>2.2.6</version> </dependency><!--工具类--> <dependency><groupId>cn.hutool</groupId><…

请编写一个函数void fun(char*ss),其功能是:将字符串ss中所有下标为奇数位置上的字母转换为大写(若该位置上不是字母,则不转换)。

本文收录于专栏:算法之翼 https://blog.csdn.net/weixin_52908342/category_10943144.html 订阅后本专栏全部文章可见。 本文含有题目的题干、解题思路、解题思路、解题代码、代码解析。本文分别包含C语言、C++、Java、Python四种语言的解法完整代码和详细的解析。 题干 请编…

三星电脑文件夹误删了怎么办?恢复方案在此

在使用三星电脑的过程中&#xff0c;我们可能会不小心删除了某个重要的文件夹&#xff0c;其中可能包含了工作文件、家庭照片、视频或其他珍贵的数据。面对这种突发情况&#xff0c;不必过于焦虑。本文将为您提供几种有效的恢复方案&#xff0c;希望能帮助您找回误删的文件夹及…

正点原子[第二期]Linux之ARM(MX6U)裸机篇学习笔记-6

前言&#xff1a; 本文是根据哔哩哔哩网站上“正点原子[第二期]Linux之ARM&#xff08;MX6U&#xff09;裸机篇”视频的学习笔记&#xff0c;在这里会记录下正点原子 I.MX6ULL 开发板的配套视频教程所作的实验和学习笔记内容。本文大量引用了正点原子教学视频和链接中的内容。…

Java面试八股之Java中为什么没有全局变量

Java中为什么没有全局变量 Java中没有传统意义上的全局变量&#xff0c;这是因为Java语言设计遵循面向对象的原则&#xff0c;强调封装性和模块化&#xff0c;以及避免全局状态带来的副作用。 封装性&#xff1a; 全局变量违反了面向对象编程中的封装原则&#xff0c;即隐藏对…

【ARM 裸机】模仿 STM32 驱动开发

1、修改驱动 对于 STM32 来说&#xff0c;使用了一个结构体将一个外设的所有寄存器都放在一起&#xff0c;在上一节的基础上进行修改&#xff1b; 1.1、添加清除 bss 段代码&#xff0c; 1.2、添加寄存器结构体 新建一个文件&#xff0c;命名imx6u.h&#xff0c;注意地址的连…