Spark-SQL核心编程(一)

news2025/4/17 19:02:33

一、Spark-SQL 基础概念

1.定义与起源:Spark SQL 是 Spark 用于结构化数据处理的模块,前身是 Shark。Shark 基于 Hive 开发,提升了 SQL-on-Hadoop 的性能,但因对 Hive 依赖过多限制了 Spark 发展,后被 SparkSQL 取代,同时产生了 SparkSQL 和 Hive on Spark 两个发展方向。

2.特点:易整合,可无缝整合 SQL 查询和 Spark 编程;统一数据访问,以相同方式连接不同数据源;兼容 Hive,能在已有仓库上运行 SQL 或 HQL;支持标准数据连接,可通过 JDBC 或 ODBC 连接。

二、Spark-SQL 核心编程

1.SparkSession:是 Spark 最新的 SQL 查询起始点,封装了 SparkContext,整合了 SQLContext 和 HiveContext 的功能,在 spark-shell 中会自动创建名为 spark 的 SparkSession 对象。

2.DataFrame 操作

DataFrame 是一种以 RDD 为基础的分布式数据集,类似于传统数据库中 的二维表格

2.1创建方式:可通过 Spark 数据源(如 JSON 文件)、现有 RDD 转换或 Hive Table 查询返回创建。从文件读取数据时,数字类型默认以 bigint 接收 。

2.2查询语法:SQL 语法需借助临时视图或全局视图,先创建 DataFrame 再创建视图,然后用 SQL 语句查询;

DSL 语法可直接操作 DataFrame,无需创建视图,支持查看 Schema、选择列、运算、过滤、分组等操作。

       (1)创建一个 DataFrame

       ( 2)查看schema信息

       (3)只查看"username"列数据

       (4)查看"username"列数据以及"age+1"数据

df.select('username, 'age + 1).show()

        (5)查看"age"大于"18"的数据

        (6)按照"age"分组,查看数据条数

与 RDD 转换:RDD 转 DataFrame 可通过引入import spark.implicits._(spark-shell 中自动导入),并借助样例类实现;DataFrame 可直接获取内部 RDD,其存储类型为 Row。

RDD 转换为 DataFrame

DataFrame 转换为 RDD

    3.DataSet 操作

    DataSet 是分布式数据集合

    3.1创建方式:可使用样例类序列或基本类型序列创建,实际中常通过 RDD 得到 DataSet。

    (1)使用样例类序列创建 DataSet

    (2)使用基本类型的序列创建 DataSet

       3.2与 RDD 转换:包含 case 类的 RDD 可自动转换为 DataSet,DataSet 也可直接获取内部 RDD

      RDD 转换为 DataSet

      DataSet 转换为 RDD

      3.3与 DataFrame 转换:DataFrame 是 DataSet 的特例(DataFrame = DataSet[Row]),二者可相互转换,DataFrame 转 DataSet 需借助样例类,DataSet 转 DataFrame 使用toDF方法。

      DataFrame 转换为 DataSet

      DataSet 转换为 DataFrame

      三、RDD、DataFrame、DataSet 关系

      产生版本:RDD 在 Spark1.0 出现,DataFrame 在 Spark1.3 出现,DataSet 在 Spark1.6 出现。

      共性:都是 Spark 平台下的分布式弹性数据集,具有惰性机制,有共同函数,操作时多需import spark.implicits._,会自动缓存运算,都有分区概念,DataFrame 和 DataSet 可通过模式匹配获取字段信息。

      区别:RDD 常与 spark mllib 使用,不支持 sparksql 操作;DataFrame 每行类型为 Row,需解析获取字段值,与 DataSet 支持 SparkSQL 操作和便捷保存方式;DataSet 是强类型,每行数据类型取决于自定义 case class ,与 DataFrame 成员函数相同但每行数据类型不同。

      本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/2335406.html

      如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

      相关文章

      AI与无人驾驶汽车:如何通过机器学习提升自动驾驶系统的安全性?

      引言 想象一下,在高速公路上,一辆无人驾驶汽车正平稳行驶。突然,前方的车辆紧急刹车,而旁边车道有一辆摩托车正快速接近。在这千钧一发的瞬间,自动驾驶系统迅速分析路况,判断最安全的避险方案,精…

      第5篇:Linux程序访问控制FPGA端LEDR<三>

      Q:如何具体设计.c程序代码访问控制FPGA端外设? A:以控制DE1-SoC开发板的LEDR为例的Linux .C程序代码。头文件fcntl.h和sys/mman.h用于使用/dev/mem文件,以及mmap和munmap内核函数;address_map_arm.h指定了DE1-SoC_Com…

      城市应急安防系统EasyCVR视频融合平台:如何实现多源视频资源高效汇聚与应急指挥协同

      一、方案背景 1)项目背景 在当今数字化时代,随着信息技术的飞速发展,视频监控和应急指挥系统在公共安全、城市应急等领域的重要性日益凸显。尤其是在关键场所,高效的视频资源整合与传输能力对于应对突发公共事件、实现快速精准的…

      【笔记ing】AI大模型-03深度学习基础理论

      神经网络:A neural network is a network or circuit of neurons,or in a modern sense,an artificial neural network,composed of artificial neurons or nodes.神经网络是神经元的网络或回路,或者在现在意义上来说,是一个由人工神经元或节…

      07软件测试需求分析案例-修改用户信息

      修改用户信息是后台管理菜单的一个功能模块,只有admin才有修改权限。包括查询用户名进行显示用户相关信息,并且修改用户相关信息的功能。 1.1 通读文档 通读需求规格说明书是提取信息,提出问题,输出具有逻辑、规则、流程的业务…

      设计模式 --- 状态模式

      状态模式​​是一种​​行为型设计模式​​,允许对象在内部状态改变时动态改变其行为​​,使对象的行为看起来像是改变了。该模式通过将状态逻辑拆分为独立类​​,消除复杂的条件分支语句,提升代码的可维护性和扩展性。 状态模式的…

      深入剖析Go Channel:从底层原理到高阶避坑指南|Go语言进阶(5)

      文章目录 引言channel的底层数据结构channel操作原理发送操作(ch <- data)接收操作(<-ch) 常见陷阱及避坑指南1. 死锁问题2. 关闭channel的错误方式3. 内存泄漏4. nil channel特性5. 性能考量 最佳实践总结 引言 Channel是Go语言实现CSP并发模型的核心机制&#xff0c;提…

      OpenCV 图形API(31)图像滤波-----3x3 腐蚀操作函数erode3x3()

      操作系统&#xff1a;ubuntu22.04 OpenCV版本&#xff1a;OpenCV4.9 IDE:Visual Studio Code 编程语言&#xff1a;C11 算法描述 使用3x3矩形结构元素腐蚀图像。 该函数通过使用中心作为锚点的3x3矩形结构元素来腐蚀源图像。腐蚀操作可以应用多次&#xff08;迭代&#xff0…

      AI Agent开发大全第二十八课-MCP实现本地命令调用怎么做的?

      开篇 MCP很强大,Client端一旦实现了稳定的连接和执行流程后任Server端随意改动都可兼容,这就是热插拨功能。 如果我们仅仅满足于MCP查点网上资料、读点图片即文字型的功能肯定是不能充分发挥MCP的强大之处的,正应了Google以及Anthropic最近的研究报告上说的:不要再在chat…

      A2A协议实现详解及示例

      A2A协议概述 A2A (Agent2Agent) 是Google推出的一个开放协议&#xff0c;旨在使AI智能体能够安全地相互通信和协作。该协议打破了孤立智能体系统之间的壁垒&#xff0c;实现了复杂的跨应用自动化。[1] A2A协议的核心目标是让不同的AI代理能够相互通信、安全地交换信息以及在各…

      活动图与流程图的区别与联系:深入理解两种建模工具

      目录 前言1. 活动图概述1.1 活动图的定义1.2 活动图的基本构成要素1.3 活动图的应用场景 2. 流程图概述2.1 流程图的定义2.2 流程图的基本构成要素2.3 流程图的应用场景 3. 活动图与流程图的联系4. 活动图与流程图的区别4.1 所属体系不同4.2 表达能力差异4.3 使用目的与语境4.4…

      图片文本识别OCR+DeepSeekapi实现提取图片关键信息

      用到的技术&#xff1a; 通过腾讯OCR文字识别&#xff0c;deepseek的api实现 目录 需求分析&#xff1a; 文字识别&#xff08;OCR&#xff09;具体实现步骤 起步工作 代码编写 deepseek整合消息&#xff0c;返回文本关键信息 起步工作 编写工具类 具体调用实现 具体…

      go 通过汇编分析函数传参与返回值机制

      文章目录 概要一、前置知识二、汇编分析2.1、示例2.2、汇编2.2.1、 寄存器传值的汇编2.2.2、 栈内存传值的汇编 三、拓展3.1 了解go中的Duff’s Device3.2 go tool compile3.2 call 0x46dc70 & call 0x46dfda 概要 在上一篇文章中&#xff0c;我们研究了go函数调用时的栈布…

      解决Ubuntu Desktop 24.04 VMware中安装后不能全屏显示,只能居中的问题

      Ubuntu Desktop 24.04 VMware中安装后不能全屏显示&#xff0c;只能居中。 sudo apt-get install open-vm-tools sudo apt-get install open-vm*

      【笔记ing】AI大模型-04逻辑回归模型

      一个神经网络结构&#xff0c;其中的一个神经网络层&#xff0c;本质就是一个逻辑回归模型 深度神经网络的本质就是多层逻辑回归模型互相连接或采用一定的特殊连接的方式连接在一起构成的。其中每一个层本质就是一个逻辑回归模型。 逻辑回归模型基本原理 逻辑回归&#xff0…

      记录学习的第二十五天

      今天终于又开始更新了。实在是星期六的蓝桥杯给了我一个大大的打击&#xff0c;今天终于好不容易缓过来了&#xff0c;可以好好学算法了。 还是老规划&#xff0c;力扣的每日一题。不过今天的每日一题我之前做过了&#xff0c;就又提交了一次来签到。 之后三道哈希表题目。 我一…

      linux电源管理(二),内核的CPUFreq(DVFS)和ARM的SCPI

      更多linux系统电源管理相关的内容请看&#xff1a;https://blog.csdn.net/u010936265/article/details/146436725?spm1011.2415.3001.5331 1 简介 CPUFreq子系统位于drivers/cpufreq目录下&#xff0c;负责进行运行过程中CPU频率和电压的动态调整&#xff0c;即DVFS (Dynami…

      ES6学习04-数组扩展:扩展运算符、新增方法

      一、扩展运算符 1. 2. eg: 3. 二、新增方法 1. arguments 元素组合 类似数组对象 2.

      滚轮控制目标臂长度调整相机距离

      通过鼠标滚轮来控制摄像机目标臂长度 , 调整相机距离 看图就行,不多说,照着连就完事了

      ​‌FireCrawl‌爬虫工具​, Craw4ai

      ‌FireCrawl‌是一款开源的AI爬虫工具&#xff0c;专门用于Web数据提取&#xff0c;并将其转换为Markdown格式或其他结构化数据。FireCrawl特别适合处理使用JavaScript动态生成的网站&#xff0c;能够自动抓取网站及其所有可访问的子页面内容&#xff0c;并将其转换为适合大语言…