python统计分析——假设概念、错误、p值和样本量

news2024/11/24 22:59:57

参考资料:python统计分析【托马斯】

1、例子

        假设你在经营一家私立教育机构,你的合同显示:如果全国平均水平时100分时,你的学生在期末考试中得了110分,你就能获得奖金;若结果明显降低,你就会失去奖金。

学生得分数据如下:109.4,76.2,128.7,93.7,85.6,117.7,117.2,87.3,100.3,55.1

图像展示如下:

# 导入库
# 用于数值处理的库
import numpy as np
import pandas as pd
import scipy as sp
from scipy import stats
# 用于绘图的库
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()
#录入学生成绩
scores=np.array([109.4,76.2,128.7,93.7,85.6,117.7,117.2,87.3,100.3,55.1])
x=np.arange(0,10)
#制作学生成绩散点图
plt.scatter(x,scores)
plt.axhline(110,linestyle=":")
plt.axhline(np.mean(scores),linestyle="-.")

        现在我们想知道:分数的均值97.1是否和110显著不同?

首先进行正态性检验:

stats.normaltest(scores)

        正态性检验(stats.normaltest())表示数据很可能来自一个正态分布。由于我们不知道我们检验的学生结果的总体方差,我们必须尽力去猜测样本方差。同时我们知道样本均值和总体均值之间的标准化的差异,即来自t分布的t统计量。

        我们样本的均值和我们想比较的值的差值是-12.9。通过样本标准差进行标准化后得到t=-1.84。因为t分布只依赖于样本数量且是一条已知的曲线,我们可以通过下面代码计算得到|t|>1.84的t统计量的可能性。

# 计算t值
tval=((110-np.mean(scores))/stats.sem(scores))
print("t-value: ", tval)
# 设置t分布
td=stats.t(len(scores)-1)
# 计算p值
p=2*td.sf(tval)
print(p)

        之所以用2*td.sf(tval),是因为我们必须综合考虑两个概率,t<-1.84和t>1.84。考虑到我们的样本数据,我们可以声明总体均值是110的可能性是9.95%。由于我们习惯上将低于5%的可能性能认为是统计学差异,我们可以作出结论:观察到的97.1并没有和110显著不同。

2、推广和应用

(1)推广

        基于前面的例子,假设检验的一般步骤如下所述:

        ①从总体中抽取一个随机样本。

        ②构建一个无效假设(即零假设)。

        ③计算一个我们已知概率分布的检验统计量。

        ④比较观测值的统计量和对应分布,我们可以得到一个和观测值同样极端或更极端的概率,就是所谓的p值。

        如果p值小于0.05,我们拒绝无效假设,并声称有统计学显著差异。

        和p值进行比较的相对值是显著性水平,经常用字母α来表示。

        这种对建设进行检验的方式叫做统计学推断。

        请记住:p值仅仅表示在无效假设为真的情况下,得到一个确定的检验统计量的值的可能性。

(2)其他案例

        ①让我们比较两组受试者的体重。零假设是两组体重之间不存在差异。如果统计学比较体重产生的p值为0.03,这意味着,零假设是正确的概率是3%。由于这个概率小于0.05,我们说,“两组的体重有显著差异”。

        ②如果我们要检验一个假设,即一个组的平均值是7,么个相应的零假设将是:“我们假设总体的平均值和7之间没有差异。”

        ③(正态性检验)如果我们检查一个数据样本是否服从正态分布,零假设就是“我的数据和正态分布的数据之间没有什么区别”:这里大的p值表示数据实际上是正态分布。

3、p值的解释

        零假设的p<0.05的值被解释为:如果零假设是真的,找到比观察到的统计量同样极端或更极端的一个检验统计量的机会小于5。这并不是说零假设是错误的,但更不能说另一种假设是正确的。

4、错误的类型

        假设检验中,会发生两种类型的错误。

(1)Ⅰ类错误

        Ⅰ类错误是指无效假设是真的时候,结果是显著的。Ⅰ类错误的可能性经常用α表示,并且该值在数据分析前就确定了。在质量控制中,Ⅰ类错误被叫作生产者风险,因为你在一个产品符合规范要求的情况下拒绝了它。

(2)Ⅱ类错误

        Ⅱ类错误是,尽管无效假设是错误的,但结果是不显著。在质量控制中,Ⅱ类错误被叫做消费者风险,因为消费者获得了一个不符合规范要求的产品。这类错误的概率通常表示为β。一个统计检验的“效能”被定义为(1-β)×100,并且这也是正确的接受备择假设的概率。

(3)解释p值的陷阱

        换句话说,p值测量的是假设的证据。不幸的是,p值经常被错误的看待成拒绝假设的错误概率,或者更糟糕的是,认为是假设为真的后验概率。

5、样本量

        一个二元假设的灵敏度/效能是当备择假设是真的时候,检验正确地拒绝了无效假设的概率 。

        决定统计学检验的效能和计算揭示一定大小效能所需要的最小样本来量,叫作效能分析。它包括4个因素:

        ①α,Ⅰ类错误的概率;

        ②β,Ⅱ类错误的概率;

        ③d,效能的大小,即所研究的效应相对样本的标准差σ的大小;

        ④n,样本大小。

        这4个参数中只有3个可以被选择,第4个自动地被固定。

(1)案例

        如果我们有这样一个假设,即我们抽样的总体均值为x1,标准差为σ,实际的总体均值为x1+D,标准差也是σ,我们可以用最小的样本量来找到这样的差异:

n=\frac{(z_{1-\alpha /2}+z_{1-\beta})^2}{d^2}

        其中,z是标准化的正态变量:

z=\frac{x-\mu}{\sigma}

        并且,d=\frac{D}{\sigma}是效应的大小。

        总的来说,如果真是的均值是x1,我们想要在1-α的检验中正确地检测;如果真是的均值偏移了D或更多,我们想要在至少1-β的概率下检测到。

        为了找到两组正态分布均值之间的差异,它们的标准差分别是σ1和σ2,为了检测出绝对差异是D,所需要的每组最小样本量是:

n_1=n_2=\frac{(z_{1-\alpha/2}+z_{1-\beta})^2+(\sigma_1^2+\sigma_2^2)}{D^2}

(2)python实现

        statsmodels很巧妙地利用了上面提到的4个变量中有3个是独立的这个事实,它将其与python一个“具名参数”的特征结合起来,提供了一个程序,接受这些参数中的三个作为输入,并计算剩下的第4个参数。例如:

# 导入库
import numpy as np
from scipy import stats
from statsmodels.stats import power


nobs=power.tt_ind_solve_power(
    effect_size=0.5,
    alpha=0.05,
    power=0.8
)
print(nobs)

        代码结果告诉我们,如果我们比较两个具有相同个体数和相同标准差的组别,需要α=0.05和检验效能80%,并且我们想检验的组间差异是标准差的一半大,那么我们需要每组64个个体。

effect_size=power.tt_ind_solve_power(
    alpha=0.05,power=0.8,nobs1=25)
print(effect_size)

        此代码结果告诉我们:如果我们的α=0.05,检验效能为80%,每组有25个个体,那么组间差异最小是样本标准差的81%。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1554866.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

听了中国电信关闭Wi-Fi双频合一功能之后,到底该连接2.4GHz还是5GHz频段?

前言 前段时间沸沸扬扬的关闭双频合一建议&#xff0c;小白也尝试关闭了一下&#xff0c;网络确实是好了不少。 有小伙伴还是有点疑虑&#xff0c;中国电信说的关闭Wi-Fi双频合一功能真的有用吗&#xff1f;点击下方蓝字一探究竟&#xff01; 中国电信建议关闭路由器的双频合一…

【Go】四、包名、访问范围控制、标识符、运算符

文章目录 1、_2、包名3、命名大小影响可访问范围4、运算符5、获取终端输入 1、_ 下划线"_"本身在Go中是一个特殊的标识符&#xff0c;称为空标识符用于忽略某个值 1&#xff09;忽略导入的没使用的包 2&#xff09;忽略某个返回值 2、包名 main包是程序的入口包&a…

2024最新华为OD机试试题库全 -【两个字符串间的最短路径问题】- C卷

1. 🌈题目详情 1.1 ⚠️题目 给定两个字符串,分别为字符串 A 与字符串 B。 例如 A字符串为 “ABCABBA”,B字符串为 “CBABAC” 可以得到下图 m * n 的二维数组,定义原点为(0,0),终点为(m,n),水平与垂直的每一条边距离为1,映射成坐标系如下图。 从原点 (0,0) 到 (0,…

Matlab与数学计算

原文地址&#xff1a;Matlab与数学计算 - Pleasure的博客 下面是正文内容&#xff1a; 前言 这是一篇笔记。主要用于介绍MatLab的作用以及其作为数学工具的使用方法。 目的是总结学校课件复习自用&#xff0c;但是不可能像相关的书籍那么系统全面&#xff0c;力求简单明了。都…

VsCode正确解决vue3+Eslint+prettier+Vetur的配置冲突

手把手教你VsCode正确解决vue3EslintprettierVetur的配置冲突 VsCode正确解决vue3EslintprettierVetur的配置冲突Eslint文档查看和修改规则&#xff1a;step1&#xff1a;首先快速浏览下规则简要setp2: ctrlF 搜索你要配置规则的英文名&#xff0c;例如attributesetp3: 修改配置…

LeetCode 热题 100 题解(一):哈希部分

《LeetCode热题 100》 经过了两个多月&#xff0c;终于刷完了代码随想录的题目&#xff0c;现在准备开始挑战热题一百了&#xff0c;接下来我会将自己的题解以博客的形式同步发到力扣和 c 站&#xff0c;希望在接下来的征程中与大家共勉&#xff01; 题组一&#xff1a;哈希 题…

OSCP靶场--RubyDome

OSCP靶场–RubyDome 考点(CVE-2022-25765 suid ruby提权) 1.nmap扫描 ┌──(root㉿kali)-[~/Desktop] └─# nmap -Pn -sC -sV 192.168.249.22 --min-rate 2500 Starting Nmap 7.92 ( https://nmap.org ) at 2024-03-29 00:28 EDT Nmap scan report for 192.168.249.22 Hos…

基于Spring Boot 3 + Spring Security6 + JWT + Redis实现接口资源鉴权

紧接上一篇文章&#xff0c;基于Spring Boot 3 Spring Security6 JWT Redis实现接口资源鉴权 系列文章指路&#x1f449; 系列文章-基于SpringBoot3创建项目并配置常用的工具和一些常用的类 项目源码&#x1f449; /shijizhe/boot-test 文章目录 1. 修改 UserDetailsServic…

【解決|三方工具】Obi Rope 编辑器运行即崩溃问题

开发平台&#xff1a;Unity 2021.3.7 三方工具&#xff1a;Unity资产工具 - Obi Rope   问题背景 使用Unity三方开发工具 - Obi Rope 模拟绳索效果。配置后运行 Unity 出现报错并崩溃。通过崩溃日志反馈得到如下图所示 这是一个序列化问题造成的崩溃&#xff0c;指向性为 Obi…

CentOS VNC

VNC服务选择 先来说说Linux上的VNC服务端&#xff0c;比较常用的就是tigervnc和x11vnc。x11vnc可以让远程访问者控制本地的实际显示器&#xff0c;而tigervnc既可以远程控制实际显示器&#xff0c;还可以控制平行独立于当前物理显示器的虚拟显示器。 1、安装 tigervnc yum i…

docker--部署 (超详版) (五)

环境准备&#xff1a;docker&#xff0c;mysql&#xff0c;redis&#xff0c;镜像&#xff0c;nginx 把虚拟机打开&#xff0c;连接xshell&#xff0c;参考博客&#xff1a; https://blog.csdn.net/m0_74229802/article/details/136965820?spm1001.2014.3001.5501 一&#x…

使用anime.js实现列表滚动轮播

官网&#xff1a;https://animejs.com/ html <div id"slide1"><div class"weather-item" v-for"item in weatherList"><div><img src"../../images/hdft/position.png" alt"">{{item.body.cityInf…

SpringBoot分布式锁自定义注解处理幂等性

SpringBoot分布式锁自定义注解处理幂等性 注解简介 注解&#xff08;Annotation&#xff09;是Java SE 5.0 版本开始引入的概念&#xff0c;它是对 Java 源代码的说明&#xff0c;是一种元数据&#xff08;描述数据的数据&#xff09;。 Java中的注解主要分为以下三类: JDK…

HTML5 和 CSS3 提高

一、HTML5 的新特性 HTML5 的新增特性主要是针对于以前的不足&#xff0c;增加了一些新的标签、新的表单和新的表单属性等。这些新特性都有兼容性问题&#xff0c;基本是 IE9 以上版本的浏览器才支持&#xff0c;如果不考虑兼容性问题&#xff0c;可以大量使用这些新特性。 声明…

账号微服务短信验证码发送工具单元测试

账号微服务短信验证码发送工具单元测试 注意sms的 app-code #----------sms短信配置-------------- sms:app-code: dd7829bedfaf4373875aa91abba82523template-id: JM1000372package net.xdclass.config;import org.springframework.context.annotation.Bean; import org.spri…

人工智能|推荐系统——搜索引擎广告

原文题目 Dark sides of artificial intelligence: The dangers of automated decision-making in search engine advertising(JASIST,2023) 人工智能的阴暗面:搜索引擎广告自动决策的危险 摘要 随着人工智能应用的日益广泛,搜索引擎供应商越来越多地要求广告商使用基于机…

Clickhouse-表引擎探索之MergeTree

引言 前文曾说过&#xff0c;Clickhouse是一个强大的数据库Clickhouse-一个潜力无限的大数据分析数据库系统 其中一个强大的点就在于支持各类表引擎以用于不同的业务场景。 MergeTree MergeTree系列的引擎被设计用于插入极大量的数据到一张表当中。数据可以以数据片段的形式一…

OpenHarmony实战:Vmware虚拟机和Ubuntu安装

避坑指南 1. 虚拟机命名、用户名称、路径不能有汉字 名称或者路径有汉字&#xff0c;导致输入失败或者安装失败 2. 虚拟机处理器内核总数&#xff08;处理器数量 X 每个处理器的内核数量&#xff09;不得超过电脑逻辑处理器总个数 太少时&#xff0c;下载代码和编译非常缓慢…

YOLOv9解读

论文地址&#xff1a;https://arxiv.org/abs/2402.13616 Github地址&#xff1a;https://github.com/WongKinYiu/yolov9 一、引言 作者认为当前深度学习方法忽略了一个事实&#xff0c;即当输入数据经过逐层特征提取和空间变换时&#xff0c;大量信息将会丢失。本文基于深入研…

ASP.NET制作试卷(单选+多选)

需求&#xff1a; 1.包含单选题、多选题。 2.所有题做完再提交。 3.提示错误、统计分数&#xff08;提交后&#xff09;。 项目结构&#xff1a; 效果展示&#xff1a; 效果展示&#xff08;视频&#xff09;&#xff1a; ASP.NET练习1效果 index.aspx代码&#xff1a; &l…