Mysql中千万数据查询浅析

news2024/11/23 10:04:34

假如mysql数据库中有一千万数据,如何进行查询,查询效率如何,下面进行简单的分析。

1、准备数据

也许有些人没遇见过上千万数据量的表,没关系,下面通过sql脚本准备一下数据,环境为:mysql5.7.+

1.1、创建表脚本

CREATE TABLE `b_log`  (
  `id` int(11) NOT NULL AUTO_INCREMENT,
  `user_id` varchar(64) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `ip` varchar(20) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `op_data` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `attr1` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `attr2` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `attr3` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `attr4` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `attr5` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `attr6` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `attr7` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `attr8` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `attr9` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `attr10` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `attr11` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  `attr12` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci NULL DEFAULT NULL,
  PRIMARY KEY (`id`) USING BTREE
) ENGINE = InnoDB AUTO_INCREMENT = 1 CHARACTER SET = utf8mb4 COLLATE = utf8mb4_general_ci ROW_FORMAT = Dynamic;

1.2、创建数据脚本

DELIMITER ;;
CREATE PROCEDURE batch_insert_log()
BEGIN
  DECLARE i INT DEFAULT 1;
  DECLARE userId INT DEFAULT 10000000;
 set @execSql = 'INSERT INTO `test`.`b_log`(`user_id`, `ip`, `op_data`, `attr1`, `attr2`, `attr3`, `attr4`, `attr5`, `attr6`, `attr7`, `attr8`, `attr9`, `attr10`, `attr11`, `attr12`) VALUES';
 set @execData = '';
  WHILE i<=10000000 DO
   set @attr = "'属性属性属性属性属性属性属性属性属性属性属性属性属性属性属性'";
  set @execData = concat(@execData, "(", userId + i, ", '10.0.69.175', '用户登录操作'", ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ")");
  if i % 1000 = 0
  then
     set @stmtSql = concat(@execSql, @execData,";");
    prepare stmt from @stmtSql;
    execute stmt;
    DEALLOCATE prepare stmt;
    commit;
    set @execData = "";
   else
     set @execData = concat(@execData, ",");
   end if;
  SET i=i+1;
  END WHILE;

END;;
DELIMITER ;

采用批量插入,效率会快很多,而且每1000条数就commit;数据量太大,会导致批量插入效率慢。本次完成数据插入花费时间: 2757.472s,大概46min,占用硬盘12GB大小,以供参考。

2、数据测试

执行存储过程添加数据挺耗时间的,大家可以观察磁盘大小的变化和所用时间。
统计表中数据记录数

SELECT count(1) FROM `b_log`

返回结果为:
在这里插入图片描述

三次查询时间分别为:15.384s,16.050s,15.413s

2.1、普通分页查询

MySQL 支持 LIMIT 语句来选取指定的条数数据,MySQL分页查询语法如下:

SELECT * FROM table LIMIT [offset,] rows | rows OFFSET offset

第一个参数指定第一个返回记录行的偏移量(可选,非必填),第二个参数指定返回记录行的最大数目;
下面我们开始测试查询结果:

SELECT * FROM `b_log` LIMIT 10000, 10

查询3次时间分别为:78ms,30ms,31ms
这样看起来速度还行,不过是本地数据库,速度自然快点。

2.2、相同偏移量,不同数据量

SELECT * FROM `b_log` LIMIT 10000, 10
SELECT * FROM `b_log` LIMIT 10000, 100
SELECT * FROM `b_log` LIMIT 10000, 1000
SELECT * FROM `b_log` LIMIT 10000, 10000
SELECT * FROM `b_log` LIMIT 10000, 100000
SELECT * FROM `b_log` LIMIT 10000, 1000000

查询时间如下:
28ms,30ms,27ms
31ms,29ms,30ms
40ms,36ms,34ms
101ms,81ms,83ms
508ms,696ms,680ms
5041ms,6556ms,7135ms
从上面结果可以看出,数据量越大,花费时间越长。

2.3、相同数据量,不同偏移量

SELECT * FROM `b_log` LIMIT 100, 100
SELECT * FROM `b_log` LIMIT 1000, 100
SELECT * FROM `b_log` LIMIT 10000, 100
SELECT * FROM `b_log` LIMIT 100000, 100
SELECT * FROM `b_log` LIMIT 1000000, 100

查询时间如下:
22ms,20ms,22ms
21ms,22ms,22ms
30ms,31ms,30ms
245ms,237ms,221ms
1757ms,1793ms,1809ms
从上面结果可以看出,偏移量越大,花费时间越长。

3、查询优化

针对偏移量大、数据量大两种情况分析其优化方式。

3.1、偏移量大优化

采用子查询方式,可以先定位偏移位置的id,然后再查询数据

# 第一条
SELECT * FROM `b_log` LIMIT 1000000, 10
# 第二条
SELECT id FROM `b_log` LIMIT 1000000, 10
# 第三条
SELECT * FROM `b_log` WHERE id >= (SELECT id FROM `b_log` LIMIT 1000000, 1) LIMIT 10

查询结果分别如下:1808ms,1417ms,1492ms

从上面结果可以看出,第一条花费时间最长,第三条比第一条花费时间短。

采用id限定方式,要求id必须是连续递增,而且计算id的范围,使用between,如下

# 第一条
SELECT * FROM `b_log` WHERE id between 1000000 AND 1000100 LIMIT 100
# 第二条
SELECT * FROM `b_log` WHERE id >= 1000000 LIMIT 100

查询结果分别如下:21ms,20ms

从上面结果可以看出,查询变快了。

3.2、数据量大优化

# 第一条
SELECT * FROM `b_log` LIMIT 1, 1000000
# 第二条
SELECT id FROM `b_log` LIMIT 1, 1000000
# 第三条
SELECT id, user_id, ip, op_data, attr1, attr2, attr3, attr4, attr5, attr6, attr7, attr8, attr9, attr10, attr11, attr12 FROM `b_log` LIMIT 1, 1000000

查询结果分别如下:4861ms,3403ms,4975ms
从上面结果可以看出,减少不需要的列,查询时间明显变少了;第一条和第三条查询时间差不多,是因为mysql服务器和mysql客户端在同一台机器上,所以查询时间差不多,若服务器和客户端分开就会不一样。

4、SELECT *

为什么要禁止 SELECT *,主要有2点原因:

  • 用 "SELECT * " 数据库需要解析更多的对象、字段、权限、属性等相关内容,在 SQL 语句复杂,硬解析较多的情况下,会对数据库造成沉重的负担;
  • 增大网络开销,* 有时会误带上如log、IconMD5之类的无用且大文本字段,数据传输size会几何增涨。特别是MySQL和应用程序不在同一台机器,这种开销非常明显;

感兴趣的小伙伴可以试试~

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/560307.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

提示msvcr120.dll丢失怎么办?由于找不到msvcr120.dll如何修复?

msvcr120.dll 是 Microsoft Visual C 文件中的一个重要组件。它是一种动态链接库&#xff0c;包含了很多函数&#xff0c;提供了许多基础的 C 运行时支持。这个库文件的主要功能是提供 C 应用程序的运行时环境&#xff0c;它是一些常用的 C 运行时库文件的集合。这些库包括了 m…

队列:数据结构中的排队之道

本篇博客会讲解队列这种数据结构&#xff0c;并使用C语言实现。 概况 什么是队列呢&#xff1f;队列是一种先进先出的数据结构&#xff0c;即First In First Out&#xff0c;简称FIFO。队列有2端&#xff0c;分别是队头和队尾&#xff0c;规定只能在队尾插入数据&#xff08;…

华为OD机试真题 Java 实现【单核CPU任务调度】【2023Q2 200分】

一、题目描述 现在有一个CPU和一些任务需要处理&#xff0c;已提前获知每个任务的任务D、优先级、所需执行时间和到达时间。 CPU同时只能运行一个任务&#xff0c;请编写一个任务调度程序&#xff0c;采用“可抢占优先权调度”调度算法进行任务调度&#xff0c;规则如 下&…

嵌入式Android系统启动基本分析

目录 第一&#xff1a;Android系统架构图&#xff1a; 第二&#xff1a;Android 系统启动流程如下&#xff1a; 第三&#xff1a;Android 层级分析 第四&#xff1a;案例分析 第五&#xff1a;Android 权限问题 上一篇我们讲了 Linux 系统的启动流程&#xff0c;本文讲解一…

QTableWidget样式设置

QTableWidget的样式分为几个部分&#xff1a; 分别是&#xff1a; 外框&#xff1a;QTableWidget 表头&#xff1a;QHeaderView 表头字段&#xff1a;QHeaderView::section 表格&#xff1a;QTableWidget::item 选中的表格&#xff1a;QTableWidget::item::selected 水平滚动条…

课时七—进程同步(一)

1、同步与互斥的基本概念 1)临界资源 &#xff08;1&#xff09;临界资源&#xff1a;是一次仅允许一个进程使用的共享资源。各进程采取互斥的方式&#xff0c;实现共享的资源称作临界资源。属于临界资源的硬件有&#xff0c;打印机&#xff0c;磁带机等&#xff1b;软件有消息…

javase个人小结

一、数据类型 二、运算符&#xff08;需要注意的&#xff09; /&#xff1a;如果是int类型&#xff0c;那么会保留整数&#xff0c;舍去余数 列如&#xff1a;10/3 3 优先级&#xff1a;拿不准就加括号&#xff0c;括号优先级最高 三、类和对象 什么是封装&#xff0c;继承…

连接器信号完整性仿真教程 三

本文将讲解CST边界&#xff08;Boundary&#xff09;、背景&#xff08;Background&#xff09;的概念及背景材料与边件设置。边界与背景是CST仿真电磁的基础&#xff0c;有必要了解它&#xff0c;并掌握其设置方法与步骤。并以两个实例演示了具体设置的操作。 一 背景、边界与…

深度学习—目标检测标注数据集

深度学习之目标检测 PASCAL数据集 PASCAL VOC挑战赛&#xff08;The PASCAL Visual Object Classes&#xff09;是一个世界级的计算机视觉挑战赛&#xff0c;PASCAL全称&#xff1a;Pattern Analysis&#xff0c;Statical Modeling and Computational Learning&#xff0c;是…

磐维数据库应用案例荣获2022年度杭州商用密码应用优秀案例二等奖

2023年5月8日上午&#xff0c;在2023西湖论剑数字安全大会商用密码应用论坛上发布了2022年度杭州商用密码应用优秀案例&#xff0c;其中由中国移动通信集团浙江有限公司和中移动信息技术有限公司联合申报的 《基于磐维数据库的CRM营销系统商用密码应用案例》荣获二等奖。 20…

Linux下gdb基础命令演示,及命令汇总图

提示&#xff1a;本文主要介绍了什么是gdb&#xff0c;以及gdb指令及其具体使用案例 ————故不积跬步&#xff0c;无以至千里&#xff1b;不积小流&#xff0c;无以成江海。 文章目录 一、gdb模式下命令一览。1.1基本命令&#xff1a;1.2 断点命令&#xff1a;1.3 数据命令…

实时频谱分析-2.3实时频谱分析

实时频谱分析 频谱分析要想归入实时类别中&#xff0c;必须没有间隙地、不确定地处理关心的频宽内包含的所有信息。RSA 必须获得时域波形中包含的全部信息&#xff0c;把信息转换成频域信号。实时完成这一点必须满足多个重要的信号处理要求&#xff1a; 1&#xff09;提供足够…

【计算思维题】少儿编程 蓝桥杯青少组计算思维真题及详细解析第3套

少儿编程 蓝桥杯青少组计算思维题及详细解析第3套 1、浩浩的左手边是 A、兰兰 B、贝贝 C、青青 D、浩浩 答案:B 考点分析:主要考查小朋友们的观察能力,从给定的图中可以看到:浩浩的左手边是贝贝,所以答案B 2、2 时 30 分,钟面上时针和分针形成的角是什么角 A、钝角…

与vCenter无法通讯时更改虚拟机的网络配置

客户的VCSA由于虚拟机的配置问题导致无法启动&#xff0c;需要通过重新创建VCSA的虚拟机配置的方式来恢复。但是&#xff0c;由于ESXi主机上的所有物理网口都已分配给了分布式网络交换机&#xff0c;在重建虚拟机配置时不能指定标准交换机的端口组来配置网络。而如果将虚拟机的…

找C++程序员工作被卡学历怎么办?我来分享一下实用的方法

当学历低的程序员找C程序员工作时&#xff0c;最担心的问题就是学历卡关。但只有资深的人力资源经理才知道那个行业内的潜规则。对于学历低的程序员来说&#xff0c;这是简直是很难逾越的关卡。 企业招聘程序员时&#xff0c;对学历的要求几乎全是本科及以上学历。这让学历低的…

C++11 列表初始化initializer_list

引子 C11&#xff0c;是继C98后的一次有力更新&#xff0c;引进了很多好用的语法&#xff0c;STL也添加了几个新容器&#xff0c;也解决了很多的问题。本篇博客就学习一下C11列表初始化的新语法和 initializer_list 文章目录 引子一. 列表初始化二. initializer_list结束语 一…

接口测试的流程?怎么设计接口测试用例?两张图给你讲的明明白白

目录 一、简介 二、接口测试的流程 三、为什么要写用例 四、接口用例设计 一、简介 在开始接口测试之前&#xff0c;我们想一下&#xff0c;接口测试的流程是什么&#xff1f;说到这里&#xff0c;有些人就会产生好奇和疑问&#xff0c;心里mmp&#xff1a;接口测试要什么流…

详细的谈谈,软件测试定义、目的及原则。

1.软件测试定义 软件测试就是在产品上线前&#xff0c;对软件需求、设计方案和编码实现的核查。软件测试的定义 软件测试是为了发现错误而执行程序的过程使用人工或自动方式来运行并测试某个系统&#xff0c;以此来检验系统是否满足规定的需求并确定预期结果与实际结果的差异 …

WEB安全:深入反射式dll注入技术

一、前言 dll注入技术是让某个进程主动加载指定的dll的技术。恶意软件为了提高隐蔽性&#xff0c;通常会使用dll注入技术将自身的恶意代码以dll的形式注入高可信进程。 常规的dll注入技术使用LoadLibraryA()函数来使被注入进程加载指定的dll。常规dll注入的方式一个致命的缺陷…

你不会还不知道如何用Python写一个切水果的小游戏吧

目录 引言 一、需要导入的包 二、窗口界面设置 三、随机生成水果位置 四、绘制字体 五、玩家生命的提示 六、游戏开始与结束的画面 七、游戏主循环 引言 水果忍者的玩法很简单&#xff0c;尽可能的切开抛出的水果就行。 今天小五就用python简单的模拟一下…