R语言随机抽取数据,并作两组数据间t检验,并保存抽取的数据,并绘制boxplot

news2024/11/20 10:21:25

前提:接着上述R脚本输出的seed结果来选择应该使用哪个seed比较合理,上个R脚本名字:
“5utr_计算ABD中Ge1和Lt1的个数和均值以及按照TE个数小的进行随机100次抽样.R”
1.输入数据:“5utr-5d做ABD中有RG4和没有RG4的TE之间的T检验.csv”
在这里插入图片描述

2.代码:“5utr_5d_ABD中有RG4和无RG4的TE之间的T检验函数+保存符合要求的seed+保存符合要求的数据框+绘制boxplot.R”

setwd("E:\\R\\Rscripts\\5UTR_extended_TE")
# 载入必要的库
library(tidyverse)
library(dplyr)
library(openxlsx)

# 读取数据
data <- read.csv("5utr-5d做ABD中有RG4和没有RG4的TE之间的T检验.csv", na.strings = "#N/A")

# 将所有的NA值转换为0
data <- data %>% mutate_all(~ifelse(is.na(.), 0, .))

############################################################  
# 调整后的process_scores函数1,适用于le1的个数小于ge1的个数且ave-le1大于ave-ge1的情况
############################################################
  process_scores <- function(df, score_name, TE_name) {
    successful_seeds <- list() # 初始化一个列表来保存成功的seed值
    combined_samples_list <- list() # 新增:初始化一个列表来保存符合条件的组合数据框
    
    for (seed_val in 1) {
      set.seed(seed_val)
      ge1 <- df %>% filter(!!sym(score_name) >= 1) %>% select(!!sym(TE_name)) %>% mutate(Source = "ge1")
      le1 <- df %>% filter(!!sym(score_name) < 1) %>% select(!!sym(TE_name)) %>% mutate(Source = "sample_le1")
      
      sample_le1 <- sample_n(le1, nrow(ge1)) # 取单一样本进行比较
      
      t_test <- t.test(ge1[[1]], sample_le1[[1]])
      mean1 <- mean(ge1[[1]])
      mean2 <- mean(sample_le1[[1]])
      
      if (mean2 < mean1 && t_test$p.value <= 0.09) {
        successful_seeds[[paste0(seed_val, "_", score_name)]] <- list(
          seed = seed_val,
          mean1 = mean1,
          mean2 = mean2,
          pvalue = t_test$p.value
        )
        # 新增:将符合条件的ge1和sample_le1合并到一个数据框中,并保存到列表中
        combined_samples <- bind_rows(ge1, sample_le1)
        combined_samples_list[[paste0(seed_val, "_", score_name)]] <- combined_samples
      }
    }
  
  # 将成功的seeds信息转换为数据框
  if (length(successful_seeds) > 0) {
    successful_seeds_df <- bind_rows(successful_seeds, .id = "seed_score") %>% mutate(Comparison = seed_score)
  } else {
    successful_seeds_df <- tibble(Comparison = character(), mean1 = numeric(), mean2 = numeric(), pvalue = numeric())
  }
  
  # 新增:将combined_samples_list中的数据框合并或以其他形式输出
  combined_samples_output <- if (length(combined_samples_list) > 0) {
    # 例如,这里我们简单地将所有符合条件的数据框合并
    bind_rows(combined_samples_list)
  } else {
    # 如果没有符合条件的,则返回空数据框
    tibble()
  }
  
  return(list(successful_seeds = successful_seeds_df, combined_samples = combined_samples_output))
}

# 对AScore5d进行处理示例
results_AScore5d <- process_scores(data, "AScore5d", "ATe5d")
results_BScore5d <- process_scores(data, "BScore5d", "BTe5d")
results_DScore5d <- process_scores(data, "DScore5d", "DTe5d")
# 打印出符合条件的successful_seeds结果进行检查
bind_results_AScore5d_successful_seeds<-rbind(results_AScore5d$successful_seeds,results_BScore5d$successful_seeds,results_DScore5d$successful_seeds)
write.xlsx(bind_results_AScore5d_successful_seeds, file = "5utr_bind_results_ABDScore5d_successful_seeds_seed1.xlsx")

# 将符合条件的组合数据框写入文件
write.table(results_AScore5d$combined_samples, "combined_samples_seed1_5utr5dAScored.csv", quote = FALSE, row.names = FALSE, sep = ",")
write.table(results_BScore5d$combined_samples, "combined_samples_seed1_5utr5dBScored.csv", quote = FALSE, row.names = FALSE, sep = ",")
write.table(results_DScore5d$combined_samples, "combined_samples_seed1_5utr5dDScored.csv", quote = FALSE, row.names = FALSE, sep = ",")

####################################################################
##
##
#接着上面的结果绘制boxplot
##
##
####################################################################
library(tidyverse)
library(ggplot2)
library(patchwork)


results_AScore5d$combined_samples$Source<-factor(results_AScore5d$combined_samples$Source,
                                                 levels=c("ge1","sample_le1"),labels=c("A with rG4","A without rG4"),ordered=TRUE)
p1<-ggplot(results_AScore5d$combined_samples, aes(x=Source,y=ATe5d,fill=Source))+#根据Type进行填充,fill=Type
  stat_boxplot(geom = "errorbar",width=0.1)+  #添加误差线
  geom_boxplot(outlier.size = -1,width=0.25)+
  theme_classic()+#背景设置为白色
  scale_fill_manual(values = c( "#8DD3C7", "#FC8D62"))+
  labs(y="TE")+
  scale_y_continuous(limits = c(0,5),breaks=seq(0,5,1))+
  theme(
    strip.background = element_rect(colour="black", fill="#FFFFFF"),
    plot.title=element_text (hjust = 0.5,vjust =1,lineheight=1,color="black"),
    panel.background=element_rect(fill="white",colour="black",linewidth =0.5),
    axis.title.y=element_text(size=25,face="plain",color="black"),
    axis.title.x=element_blank(),
    axis.text = element_text(size=20,face="plain",color="black"),
    #axis.tex用来调整描述x轴的文本,比如图中的conserved等
    panel.border = element_blank(),
    panel.grid.major = element_blank(),
    panel.grid.minor = element_blank(),
    axis.ticks.x=element_line(colour="black"),
    axis.ticks.length.x=grid::unit(0.2, "cm")
  )+guides(fill="none")


results_BScore5d$combined_samples$Source<-factor(results_BScore5d$combined_samples$Source,
                                                 levels=c("ge1","sample_le1"),labels=c("B with rG4","B without rG4"),ordered=TRUE)
p2<-ggplot(results_BScore5d$combined_samples, aes(x=Source,y=BTe5d,fill=Source))+#根据Type进行填充,fill=Type
  stat_boxplot(geom = "errorbar",width=0.1)+  #添加误差线
  geom_boxplot(outlier.size = -1,width=0.25)+
  theme_classic()+#背景设置为白色
  scale_fill_manual(values = c( "#8DD3C7", "#FC8D62"))+
  labs(y="TE")+
  scale_y_continuous(limits = c(0,5),breaks=seq(0,5,1))+
  theme(
    strip.background = element_rect(colour="black", fill="#FFFFFF"),
    plot.title=element_text (hjust = 0.5,vjust =1,lineheight=1,color="black"),
    panel.background=element_rect(fill="white",colour="black",linewidth =0.5),
    axis.title.y=element_text(size=25,face="plain",color="black"),
    axis.title.x=element_blank(),
    axis.text = element_text(size=20,face="plain",color="black"),
    #axis.tex用来调整描述x轴的文本,比如图中的conserved等
    panel.border = element_blank(),
    panel.grid.major = element_blank(),
    panel.grid.minor = element_blank(),
    axis.ticks.x=element_line(colour="black"),
    axis.ticks.length.x=grid::unit(0.2, "cm")
  )+guides(fill="none")

results_DScore5d$combined_samples$Source<-factor(results_DScore5d$combined_samples$Source,
                                                 levels=c("ge1","sample_le1"),labels=c("D with rG4","D without rG4"),ordered=TRUE)
p3<-ggplot(results_DScore5d$combined_samples, aes(x=Source,y=DTe5d,fill=Source))+#根据Type进行填充,fill=Type
  stat_boxplot(geom = "errorbar",width=0.1)+  #添加误差线
  geom_boxplot(outlier.size = -1,width=0.25)+
  theme_classic()+#背景设置为白色
  scale_fill_manual(values = c( "#8DD3C7", "#FC8D62"))+
  labs(y="TE")+
  scale_y_continuous(limits = c(0,5),breaks=seq(0,5,1))+
  theme(
    strip.background = element_rect(colour="black", fill="#FFFFFF"),
    plot.title=element_text (hjust = 0.5,vjust =1,lineheight=1,color="black"),
    panel.background=element_rect(fill="white",colour="black",linewidth =0.5),
    axis.title.y=element_text(size=25,face="plain",color="black"),
    axis.title.x=element_blank(),
    axis.text = element_text(size=20,face="plain",color="black"),
    #axis.tex用来调整描述x轴的文本,比如图中的conserved等
    panel.border = element_blank(),
    panel.grid.major = element_blank(),
    panel.grid.minor = element_blank(),
    axis.ticks.x=element_line(colour="black"),
    axis.ticks.length.x=grid::unit(0.2, "cm")
  )+guides(fill="none")
p4<-p1+p2+p3+plot_layout(widths = c(1,1,1))
ggsave("boxplot-5utr-5d做ABD中有RG4和没有RG4的TE之间的T检验.pdf",plot=p4,width=24,height=10)

3.输出数据:“5utr_bind_results_ABDScore5d_successful_seeds_seed1.xlsx”
在这里插入图片描述

4.输出boxplot:“boxplot-5utr-5d做ABD中有RG4和没有RG4的TE之间的T检验.pdf”
在这里插入图片描述

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1547439.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

String类(三)

文章目录 string类&#xff08;三&#xff09;string类的模拟实现&#xff1a;1.默认成员变量和函数2.string的长度和下表引用3.字符串拷贝构造4. 赋值拷贝5.字符串比较6.字符串的增添操作7.insert插入操作8.遍历字符 string类&#xff08;三&#xff09; string类的模拟实现&…

jupyter lab使用虚拟环境

python -m ipykernel install --name 虚拟环境名 --display-name 虚拟环境名然后再启动jupyter lab就行了

【Unity】调整Player Settings的Resolution设置无效

【背景】 Build时修改了Player Settings下的Resolution设置&#xff0c;但是再次Building时仍然不生效。 【分析】 明显是沿用了之前的分辨率设定&#xff0c;所以盲猜解决办法是Build相关的缓存文件&#xff0c;或者修改打包名称。 【解决】 实测修改版本号无效&#xf…

IDEA使用常用的设置

一、IDEA常用设置 可参考&#xff1a;IDEA这样配置太香了_哔哩哔哩_bilibili 波波老师 二、插件 可参考&#xff1a;IDEA好用插件&#xff0c;强烈推荐_哔哩哔哩_bilibili 波波老师 三、其他 学会用点“.” IDEA弹窗Servers certificate is not trusted怎么禁止&#xf…

基于SSM作业提交与批改

基于SSM作业提交与批改的设计与实现 摘要 社会的进步导致人们对于学习的追求永不止境&#xff0c;那么追求学习的方式也从单一的书本教程变成了多样化的学习方式。多样化的学习方式不仅仅是需要人们智慧的依靠&#xff0c;还需要能够通过软件的加持进行信息化的价值体现。软件…

uniapp开发小程序遇到的问题,持续更新中

一、uniapp引入全局scss 在App.vue中引入uni.scss <style lang"scss">/* #ifndef APP-NVUE */import "uni.scss";/* #endif */ </style>注意&#xff1a;nvue页面的样式在编译时&#xff0c;有很多样式写法被限制了&#xff0c;容易报错。所…

干货分享DS5L1伺服电机通过倍讯科技485转 Profinet 网关与西门子PLC进行通信的配置方法

倍讯科技485转 ProfinetDS5L1 伺服电机与 Profinet 网关进行通信需要了解 Profinet 协议和伺服电机的具体通信要求。以下是您可以如何解决此问题的总体概述&#xff1a; 了解 Profinet&#xff1a;Profinet 是自动化工业以太网标准。您需要了解 Profinet 的工作原理、其寻址方案…

2024 解决 Failed to launch process [ElasticSearch]

操作系统&#xff1a;centos 7 (x86) sonarQube不能使⽤root账号进⾏启动&#xff0c;所以需要创建普通⽤户及其⽤户组 一、问题描述&#xff1a;使用root启动时&#xff0c;一直反馈 SonarQube is not running 问题原因&#xff1a;不能够使用root用户进行启动 解决方案…

三点估算计算

当历史数据不充分时&#xff0c;通过考虑估算中的不确定性和风险&#xff0c;可以提高活动持续时间估算的准确性。使用三点估算有助于界定活动持续时间的近似区间: 乐观时间&#xff08;Optimistic Time&#xff0c;To&#xff09;&#xff1a;在任何事情都顺利的情况下&#…

DFS深度优先搜索刷题(二)

一.P1683 入门 算法思想&#xff1a;设置瓷砖状态st&#xff0c;这里瓷砖状态是否走过决定计数与否&#xff0c;因为可以重复走过但只记一次&#xff0c;所以可以不用回溯。每一次dfs都记录此时的坐标与进入可能的新坐标。 const int N 25;int W, H; char map[N][N];//存地图…

20240319-2-机器学习基础面试题

⽼板给了你⼀个关于癌症检测的数据集&#xff0c;你构建了⼆分类器然后计算了准确率为 98%&#xff0c; 你是否对这个模型很满意&#xff1f;为什么&#xff1f;如果还不算理想&#xff0c;接下来该怎么做&#xff1f; 首先模型主要是找出患有癌症的患者&#xff0c;模型关注的…

苹果与百度合作,将在iPhone 16中使用生成式AI

3月25日&#xff0c;《科创板日报》消息&#xff0c;苹果将与百度进行技术合作&#xff0c;为今年即将发布的iPhone16、Mac系统和iOS 18提供生成式AI&#xff08;AIGC&#xff09;功能。 据悉&#xff0c;苹果曾与阿里巴巴以及另外一家国产大模型厂商进行了技术合作洽谈。最终…

机器学习模型及其使用方法——《机器学习图解》

本书教你两件事——机器学习模型及其使用方法 机器学习模型有不同的类型&#xff0c;有些返回确定性的答案&#xff0c;例如是或否&#xff0c;而另一些返回概率性的答案。有些以问题的形式呈现&#xff1b;其他则使用假设性表达。这些类型的一个共同点是它们都返回一个答案或…

单链表专题(上)(顺序表链表线性表)

在开始之前思考一个顺序表的问题 1. 中间/头部的插⼊删除&#xff0c;时间 复杂度为O(N) 2. 增容需要申请新空间&#xff0c;拷⻉数据&#xff0c;释放旧空间。会有不⼩的消耗。 3. 增容⼀般是呈2倍的增⻓&#xff0c;势必会有⼀定的空间浪费。例如当前容量为100&#xff0c;…

HTML(二)---【常见的标签使用】

零.前言 本文只介绍常见的标签使用&#xff0c;其中使用的一些HTML专业术语可以在作者的第一篇文章&#xff1a; HTML&#xff08;一&#xff09;---【基础】-CSDN博客中找到。 一.<b>粗体、<i>或<em>斜体 1.定义 粗体、斜体的实现可以在CSS中实现&…

DaisyDisk for mac 苹果电脑磁盘清理工具

DaisyDisk for Mac是一款直观易用的磁盘空间分析工具&#xff0c;专为Mac用户设计&#xff0c;旨在帮助他们快速识别和管理磁盘上的文件与文件夹&#xff0c;从而释放存储空间。 软件下载&#xff1a;DaisyDisk for mac 激活版 DaisyDisk采用独特的可视化界面&#xff0c;将磁盘…

基于uniapp微信小程序我的钱包页面

基于uniapp color ui 页面效果图&#xff1a; 代码部分&#xff1a; https://download.csdn.net/download/kay523393/89035927

微信商家转账到零钱:实用指南,涵盖开通、使用与常见问题

商家转账到零钱是什么&#xff1f; 商家转账到零钱功能整合了企业付款到零钱和批量转账到零钱&#xff0c;支持批量对外转账&#xff0c;操作便捷。如果你的应用场景是单付款&#xff0c;体验感和企业付款到零钱基本没差别。 商家转账到零钱的使用场景有哪些&#xff1f; 这…

CMake学习笔记(一)一个最简单的CMakeLists嵌套示例

目录 1 mkdir project_macro 2 在project_marco中建立CMakeLists.txt 3 建立专门的src文件夹 4 在src中添加main.cpp和CMakeLists.txt 5 回到project_macro目录&#xff0c;建立build文件夹 6 进入build 文件夹&#xff0c;开始cmake 7 在build文件夹里执行make指令 8 …

Python7:接口自动化学习1 RPC

API&#xff08;Application Programmming Interface&#xff09; 应用编程接口&#xff0c;简称“接口” 接口&#xff1a;程序之间约定的通信方法 特点&#xff1a;约定了调用方法&#xff0c;以及预期的行为&#xff0c;但是不透露具体细节 意义&#xff1a;程序能解耦&…