星光下的赶路人star的个人主页
臣书刷字墨淋漓,舒卷烟云势最奇
文章目录
- 1、数据倾斜的现象
- 2、解决办法
- 2.1 单表聚合(group by+sum())
- 2.2 多表关联(join)
- 3、倾斜原因
1、数据倾斜的现象
部分Reduce一直运行,时间明显比已完成的长20倍以上
2、解决办法
2.1 单表聚合(group by+sum())
1、开启map端预聚合:hive.map.aggr=true
2、打散、二次聚合:
开启参数:hive.groupby.skewindata=true
sql手动实现
2.2 多表关联(join)
1、大小表:map join
2、大大表:
方法一:将倾斜的key单独拿出来做mapjoin
hive。optimize。skewjoin=true
方法二:打散倾斜key,扩容对方的key
sql手动实现
3、倾斜原因
1、数据本身是不均匀的(最常见,最正常的)
2、null值
没有意义的null值,过滤掉
有意义的null值,正常处理
您的支持是我创作的无限动力
希望我能为您的未来尽绵薄之力
如有错误,谢谢指正;若有收获,谢谢赞美