阿里云大数据实战记录10:Hive 兼容模式的坑

news2024/11/24 23:12:25


文章目录

    • 1、前言
    • 2、什么是 Hive 兼容模式?
    • 3、为什么要开启 Hive 模式?
    • 4、有什么副作用?
    • 5、如何开启 Hive 兼容模式?
    • 6、该场景下,能不能不开启 Hive 兼容模式?
    • 7、为什么不是`DATE_FORMAT(datetime, string)`?
    • 8、小结

1、前言

今天在开发一个表单的时候,MaxCompute 抛给我一个错误:

SQL Runtime Unretryable Error: ODPS-0121125:[xx,xx] Unsupported operation - function signature DATE_FORMAT(string, string) is not supported in current mode, please set odps.sql.hive.compatible=true to use it

什么意思呢?就是告诉我 MaxCompute 不支持这个语法DATE_FORMAT(string, string),但是如果我还是想用的话可以加上一个配置:set odps.sql.hive.compatible=true,这样就可以使用以上语法。

这个报错原本的 SQL 可以抽象为:

SELECT DATE_FORMAT(FROM_UNIXTIME(1672538400),'yyyyMMdd')

也就是FROM_UNIXTIME(1672538400)返回结果被当作 STRING 数据类型处理了。而DATE_FORMAT(string, string)需要加上set odps.sql.hive.compatible=true才能正常工作。

2、什么是 Hive 兼容模式?

那么这个配置(set odps.sql.hive.compatible=true)是什么意思呢?
这个配置就是开启 Hive 兼容模式,使得在 MaxCompute SQL 中可以使用 Hive SQL 的函数语法。

3、为什么要开启 Hive 模式?

因为有一些函数的用法 MaxCompute 不支持,或者有差异,要开启 Hive 模式才能使用。
比如说上面报错:DATE_FORMAT()函数如果传入的参数是 STRING 类型,则需要开启 Hive 兼容模式才可以使用。否则就报错。

如上,MaxCompute 中,使用DATE_FORMAT()函数时,传入的参数不支持 STRING 类型,DATE_FORMAT(string,string)在 Hive SQL 才被支持,所以需要通过开启 Hive 兼容模式来使用它。

4、有什么副作用?

当然!肯定会有副作用,因为 Hive 模式和非 Hive 模式的一些函数的返回值是不同的。
比如说FROM_UNIXTIME()函数,它在 Hive 兼容模式下的返回值为 STRING 类型,而在 ODPS 1.0 和 ODPS 2.0 数据类型版本的返回值为 DATETIME 类型。

这会有什么影响呢?如果你使用过 MaxCompute 进行数据开发,一定不会陌生:MaxCompute 在数据类型一致性这方面要求会比较苛刻,绝大多数场景下数据类型不一致会无法判断

这时,要么抛出错误,要么直接返回空值,前者还容易处理,进行显性调整数据类型即可,后者就有点摸不着头脑,需要逐步排查。

所以,返回数据类型改变了,最大的影响就是取不到数据,也正因为这个原因,开发的表单一定要进行数据校验,避免翻车。

说个题外话,数据类型一致性这点在 MySQL 上几乎是看不见的,因为 MySQL 会帮我们进行隐式转换,不需要我们另外处理,所以在 MySQL 上,基本不需要太过担心数据类型的问题,正因为这点它特别适合小白入门~~

更多的“副作用”可参考下图:

参考链接:https://help.aliyun.com/zh/maxcompute/user-guide/hive-compatible-data-type-edition

image.png

5、如何开启 Hive 兼容模式?

了解了 Hive 的正面作用和副作用之后,还是决定使用,就可以打开 Hive 开关尽情“享用”啦!

设置开关语法:

set odps.sql.hive.compatible=true; -- 打开Hive兼容模式。

使用方法,放在 SQL前面,和 SQL 一起执行,每一个设置命令作为一个独立的语句,用;结尾:

set odps.sql.hive.compatible=true;   --打开Hive兼容模式
SELECT xxx FROM xxx;

为了保证无差异,把 ODPS 2.0 的设置一同加上。

set odps.sql.type.system.odps2=true; --打开MaxCompute 2.0数据类型。
set odps.sql.decimal.odps2=true;     --打开Decimal 2.0数据类型。
set odps.sql.hive.compatible=true;   --打开Hive兼容模式。
SELECT xxx FROM xxx;

所以,开启 Hive 兼容模式最终得到的解决方案如下:

set odps.sql.type.system.odps2=true; --打开MaxCompute 2.0数据类型。
set odps.sql.decimal.odps2=true;     --打开Decimal 2.0数据类型。
set odps.sql.hive.compatible=true;   --打开Hive兼容模式。
SELECT FROM_UNIXTIME(1672538400),DATE_FORMAT(FROM_UNIXTIME(1672538400),'yyyyMMdd');

结果如下:
image.png

6、该场景下,能不能不开启 Hive 兼容模式?

肯定的!查看 MaxCompute 的官方文档可以看到以下片段:

DATE_FORMAT 函数链接:https://help.aliyun.com/zh/maxcompute/user-guide/date-format

image.png

MaxCompute 的DATE_FORMAT()函数总共支持4个类型的参数:DATE、DATETIME、TIMESTAMP 和 STRING。其中三个:DATE、DATETIME 和 STRING类型只能在 Hive 兼容模式下使用,还有一个:TIMESTAMP 可以在非 Hive 兼容模式下使用。

那么使用CAST(FROM_UNIXTIME(1672538400)AS TIMESTAMP)将数据类型转化为 TIMESTAMP 便可!

set odps.sql.type.system.odps2=true; --打开MaxCompute 2.0数据类型。
set odps.sql.decimal.odps2=true; 		 --打开Decimal 2.0数据类型。
set odps.sql.hive.compatible=false;  --关闭Hive兼容模式。
select FROM_UNIXTIME(1672538400),DATE_FORMAT(CAST(FROM_UNIXTIME(1672538400) AS TIMESTAMP),'yyyyMMdd');

返回结果如下:
image.png

7、为什么不是DATE_FORMAT(datetime, string)

在上面的描述过程中,不知道你是否留意到,其实还有一个问题没有解决?

FROM_UNIXTIME()函数,它在 Hive 兼容模式下的返回值为 STRING 类型,而在 ODPS 1.0 和 ODPS 2.0 数据类型版本的返回值为 DATETIME 类型。但是我在没有开启 Hive 兼容模式下,返回的报错却是 MaxCompute 不支持这个语法DATE_FORMAT(string, string),而不是DATE_FORMAT(datetime, string)

那么实际上非 Hive 兼容模式是返回 STRING 还是 DATETIME 呢?

为了回答这个疑问,我做了一个验证:测试验证 FROM_UNIXTIME()在不同的模式下返回的数据类型。

说明:

  • 时间戳1672538400转换为时间格式是2023-01-01 10:00:00
  • DATE()是 ODPS 2.0 才有的语法,需要打开 ODPS 2.0 开关,有的项目直接设置打开 ODPS2,但为了保险起见,这里再设置一下,你可以查看项目的相关配置是否有开启,如果开启则不需要再设置。
  • 查文档可知:FROM_UNIXTIME()在 Hive 兼容模式下返回 STRING,在非 Hive 兼容模式下返回 DATETIME;

【测试1】开启 Hive 兼容模式,FROM_UNIXTIME(1672538400)是否返回 STRING 类型?

set odps.sql.type.system.odps2=true; --打开MaxCompute 2.0数据类型。
set odps.sql.decimal.odps2=true;     --打开Decimal 2.0数据类型。
set odps.sql.hive.compatible=true;   --打开Hive兼容模式。
SELECT FROM_UNIXTIME(1672538400),FROM_UNIXTIME(1672538400)='2023-01-01 10:00:00';

返回结果如下,符合预期。

image.png

【测试2】关闭 Hive 兼容模式,FROM_UNIXTIME(1672538400)是否返回 DATETIME 类型?

set odps.sql.type.system.odps2=true; --打开MaxCompute 2.0数据类型。
set odps.sql.decimal.odps2=true;     --打开Decimal 2.0数据类型。
set odps.sql.hive.compatible=false;  --关闭Hive兼容模式。
SELECT FROM_UNIXTIME(1672538400),FROM_UNIXTIME(1672538400)='2023-01-01 10:00:00';

结果如下:

image.png

什么情况?也相等?通过FROM_UNIXTIME(1672538400)='2023-01-01 10:00:00'判断进行了隐式转换?既然不管等号右边是 STRING 还是 DATATIME,都返回 true。改个方式,使用DATE()辅助判断。

说明:DATE()函数传入的值是时间格式'yyyy-MM-dd'的字符串或者 DATETIME 类型才会返回日期值,如果是时间格式'yyyy-MM-dd hh:mi:ss'的字符串,返回空值。

【测试3】改用DATE()函数辅助判断:开启 Hive 兼容模式,DATE(FROM_UNIXTIME(1672538400))是否返回空值?

set odps.sql.type.system.odps2=true; --打开MaxCompute 2.0数据类型。
set odps.sql.decimal.odps2=true;     --打开Decimal 2.0数据类型。
set odps.sql.hive.compatible=true;   --关闭Hive兼容模式。
SELECT FROM_UNIXTIME(1672538400),DATE(FROM_UNIXTIME(1672538400));

结果如下,符合预期。

image.png

【测试4】改用DATE()函数辅助判断:关闭 Hive 兼容模式,DATE(FROM_UNIXTIME(1672538400))是否返回日期?

set odps.sql.type.system.odps2=true; --打开MaxCompute 2.0数据类型。
set odps.sql.decimal.odps2=true;     --打开Decimal 2.0数据类型。
set odps.sql.hive.compatible=false;   --关闭Hive兼容模式。
SELECT FROM_UNIXTIME(1672538400),DATE(FROM_UNIXTIME(1672538400));

结果如下,符合预期。

image.png

【补充测试】DATE('2023-01-01 10:00:00')DATE(CAST('2023-01-01 10:00:00' as datetime))返回的结果是否是空值和时间字段?

set odps.sql.type.system.odps2=true; --打开MaxCompute 2.0数据类型。
SELECT DATE('2023-01-01 10:00:00'),DATE(CAST('2023-01-01 10:00:00' AS DATETIME));

返回结果如下,符合预期。

image.png

以上通过间接的方式验证了在 MaxCompute 中,FROM_UNIXTIME()在 Hive 兼容模式下返回 STRING,在非 Hive 兼容模式下返回 DATETIME。

非 Hive 兼容模式下,FROM_UNIXTIME(1672538400)确实是返回的是 DATETIME 类型,那么就是 DATETIME 类型传入DATE_FORMAT()时,会被转换为 STRING 类型进行处理。

8、小结

解决 MaxCompute 不支持这个语法DATE_FORMAT(string, string)的方法本文提供了两种:

  • 方法1:开启 Hive 兼容模式
set odps.sql.type.system.odps2=true; --打开MaxCompute 2.0数据类型。
set odps.sql.decimal.odps2=true;     --打开Decimal 2.0数据类型。
set odps.sql.hive.compatible=true;   --打开Hive兼容模式。
SELECT FROM_UNIXTIME(1672538400),DATE_FORMAT(FROM_UNIXTIME(1672538400),'yyyyMMdd');
  • 方法2:显性修改传入FROM_UNIXTIME(1672538400)返回的数据类型
set odps.sql.type.system.odps2=true; --打开MaxCompute 2.0数据类型。
set odps.sql.decimal.odps2=true; 		 --打开Decimal 2.0数据类型。
set odps.sql.hive.compatible=false;  --关闭Hive兼容模式。
select FROM_UNIXTIME(1672538400),DATE_FORMAT(CAST(FROM_UNIXTIME(1672538400) AS TIMESTAMP),'yyyyMMdd');

另外,传递给DATE_FORMAT()的参数如果是 DATETIME 类型,会被隐性转换为 STRING 处理。





往期回顾:

阿里云大数据实战记录9:MaxCompute RAM 用户与授权
阿里云大数据实战记录8:拆开 json 的每一个元素,一行一个
阿里云大数据实战记录7:如何处理生产环境表单的重复数据

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1015310.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

【小记录】jupyter notebook新版本

手欠升级 😅今天手贱,在anaconda navigator里面更新了最新版本的spyder,然后莫名奇妙地jupyter notebook就打不开了😅,报错说缺少模块”ModuleNotFoundError: No module named jupyter_server.contents“,…

给微信小程序添加隐私协议

前些日子,微信官方针对用户的安全信息又进行了增强,这次更新几乎要求所有的小程序都需要进行整改,只要是涉及到用户的隐私的小程序都需要进行整改,这次整改是强制性的。 点开相关指引之后会跳转到下面的链接:参考链接…

解决php导出excel中小数尾部0不显示的问题

调整代码前: 新增代码: //小数避免末尾0不显示的问题 foreach ($list as &$line) {foreach ($line as &$column) {if (is_numeric($column) && strpos($column, .)!false) {$column " {$column} ";}} } 效果&#xf…

【【萌新的riscV的学习之关于risc指令集的学习使用总五】】

萌新的riscV的学习之关于risc指令集的学习使用总五 opcode(操作码) 指令的基本操作 rd目的操作数寄存器 用来存放操作结果 funct3 一个另外的操作码字段 rs1: 第一个源操作数寄存器 rs2: 第二个源操作数寄存器 funct7: 一个另外的操作码字段 还有一种I型…

ApplicationContext实现

基于classpath下的xml格式的配置文件来创建bean对象 java代码 package com.example;import org.slf4j.Logger; import org.slf4j.LoggerFactory; import org.springframework.context.support.ClassPathXmlApplicationContext; import org.springframework.context.support.Fi…

力扣刷题班 第3课 02-分治与回溯算法

分治(例题1)九键电话号码的字母组合 电话号码的字⺟组合 给定⼀个仅包含数字 2-9 的字符串,返回所有它能表示的字⺟组合。答案可以按 任意顺序 返回。 给出数字到字⺟的映射如下(与电话按键相同)。注意 1 不对应任何字…

【计算机视觉】Image Feature Extractors方法介绍合集(二)

文章目录 一、Mixed Depthwise Convolution二、Deformable Kernel三、Dynamic Convolution四、Submanifold Convolution五、CondConv六、Active Convolution七、Depthwise Dilated Separable Convolution八、Involution九、Dilated convolution with learnable spacings十、Att…

Elastic Stack 8.10:更简单的跨集群搜索和身份验证等等

作者:Tyler Perkins, Gilad Gal, Shani Sagiv, George Kobar, Michael Peterson, Aris Papadopoulos Elastic Stack 8.10 增强了跨集群和向量搜索、数据摄取、Kibana 和云注册。 配置远程搜索时获得更大的灵活性,并提供更多信息来分类问题,…

小白备战大厂算法笔试(八)——搜索

搜索 二分查找 二分查找是一种基于分治策略的高效搜索算法。它利用数据的有序性,每轮减少一半搜索范围,直至找到目标元素或搜索区间为空为止。 Question: 给定一个长度为n的数组 nums ,元素按从小到大的顺序排列,数组…

git基本手册

Git and GitHub for Beginners Tutorial - YouTube Kevin Stratvert git config --global user.name “xxx” git config --global user.email xxxxx.com 设置默认分支 git config --global init.default branch main git config -h查看帮助 详细帮助 git help config 清除 cl…

计网第五章(运输层)(二)(端口号、复用和分用)

一、端口号 (1)基本概念 在上部分(计网第五章(运输层)(一)_永无魇足的博客-CSDN博客)提到运输层用不同的端口对应不同的应用进程。 端口就是用来区分不同应用进程的标识符。 每个…

HarmonyOS/OpenHarmony应用开发-DevEco Studio新建项目的整体说明

一、文件-新建-新建项目 二、传统应用形态与IDE自带的模板可供选用与免安装的元服与IDE中自带模板的选择 三、以元服务,远程模拟器为例说明IDE整体结构 1区是工程目录结构,是最基本的配置与开发路径等的认知。 2区是代码开发与修改区,是开发…

分支分支分支分支

分支 查看分支 git branch -v 创建分支 git branch 分支名 切换分支 git checkout 分支名 合并分支 git merge 分支名 把指定的分支合并到当前分支上

【CMU15-445 Part-11】Join Algorithms

Part11-Join Algorithms Why Do We Need to Join? Join其实是关系数据库和范式化表时候所产生的副产物。 也就是说我们范式化表是为了减少冗余信息,而我们使用join就是为了去重建reconstruct 这些原本的tuple Join Algorithms 主要关注两表的inner equijoin a…

UE5学习笔记(1)——从源码开始编译安装UE5

目录 0. 前期准备1. Git bash here2. 克隆官方源码。3. 选择安装分支4. 运行Setup.bat,下载依赖文件5. 运行GenerateProjectFiles.bat生成工程文件6. 生成完成,找到UE5.sln/UE4.sln7. 大功告成 0. 前期准备 0.1 在windows的话,建议装一个Git…

基于SpringBoot的驾校管理系统

基于SpringBootVue的驾校管理系统、前后端分离 开发语言:Java数据库:MySQL技术:SpringBoot、Vue、Mybaits Plus、ELementUI工具:IDEA/Ecilpse、Navicat、Maven 【主要功能】 角色:管理员、用户、教练 管理员&#x…

Python 可迭代对象、迭代器、生成器

可迭代对象 定义 在Python的任意对象中,只要它定义了可以返回一个迭代器的 __iter__ 魔法方法,或者定义了可以支持下标索引的 __getitem__ 方法,那么它就是一个可迭代对象,通俗的说就是可以通过 for 循环遍历了。Python 原生的列…

(手撕)数据结构--->堆

文章内容 目录 一:堆的相关概念与结构 二:堆的代码实现与重要接口代码讲解 让我们一起来学习:一种特殊的数据结构吧!!!! 一:堆的相关概念与结构 在前面我们已经简单的学习过了二叉树的链式存储结…

城市管网污水监测方案,科技助力污水排放管理!

根据《国务院办公厅关于加强入河入海排污口监督管理工作的实施意见》各地要明确“水污染,谁治理”和政府兜底的原则,明确排污主体责任。根据排污口类型集中整治,划分主体。加大私设暗管借道排污的监察力度溯源主体责任。加强科技研发&#xf…

【数据结构】C++实现AVL平衡树

文章目录 1.AVL树的概念2.AVL树的实现AVL树结点的定义AVL树的插入AVL树的旋转左单旋右单旋左右双旋右左双旋插入代码 AVL树的验证AVL树的查找AVL树的修改AVL树的删除AVL树的性能 AVL树的代码测试 1.AVL树的概念 二叉搜索树虽然可以提高我们查找数据的效率,但如果插…