[大数据] Hive小文件的解决方案

开发: C++知识库 Java知识库 JavaScript Python PHP知识库人工智能区块链大数据移动开发嵌入式开发工具数据结构与算法开发测试游戏开发网络协议系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑笔记本显卡显示器固态硬盘硬盘耳机手机 iphone vivo oppo 小米华为单反装机图拉丁

-> 大数据 -> Hive小文件的解决方案 -> 正文阅读

[大数据]Hive小文件的解决方案

第一种：从数据产生的途径上进行解决。
1）尽量用sequencefile (SequenceFile文件是Hadoop用来存储二进制形式的key-value对而设计的一种平面文件(Flat File)。)，减少使用textfile (文本文件)，从一定程度上能减少小文件的产生。
2）可以减少reduce的个数，
3）少用动态表，多用distribute by 分区

第二种：对于已经存在的小文件进行解决方案。

1）可以用hadoop achieve 归档命令，对文件进行归档。
2）重建表，重建表的时候来设置减少reduce的数量。
3）设置map/reduce 的参数

设置map输入合并小文件的相关参数：

每个map最大输入大小（这个值决定 了合并后文件的数量）
set mapred.max.split.size = 256000000;
一个节点上的split的至少的大小（这个值决定了多个DataNode上的文件是否需要合并）
set mapred.min.split.size.per.node = 100000000;
一个交换机下split的至少的大小（这个值决定了多个交换机上的文件是否需要合并）
set mapred.min.split.size.per.rack = 100000000;
执行Map前进行小文件合并
set hive.input.format = org.apache.hadoop.hive.ql.io.CombinHiveInput;

设置map输出和reduce输出进行合并的相关参数：

设置map端输出进行合并，默认为true
set hive.merge.mapfiles = true;
设置reduce端输出进行合并，默认为false
set hive.merge.mapredfiles = true;
设置合并文件的大小
set hive.merge.size.per.task = 256*1000*1000;
当输出文件的平均数小于该值师，启动一个独立的Mapreduce任务进行文件merge.
set hive.merge.smailfiles.avgsize = 16000000;

大数据最新文章

实现Kafka至少消费一次

亚马逊云科技：还在苦于ETL？Zero ETL的时代

初探MapReduce

【SpringBoot框架篇】32.基于注解+redis实现

Elasticsearch：如何减少 Elasticsearch 集

Go redis操作

Redis面试题

专题五 Redis高并发场景

基于GBase8s和Calcite的多数据源查询

Redis——底层数据结构原理

加:2021-09-23 11:32:08 更:2021-09-23 11:33:53

360图书馆购物三丰科技阅读网日历万年历 2026年3日历

-2026/3/10 10:08:28-

图片自动播放器
↓图片自动播放器↓

TxT小说阅读器
↓语音阅读,小说下载,古典文学↓

一键清除垃圾
↓轻轻一点,清除系统垃圾↓

图片批量下载器
↓批量下载图片,美女图库↓

网站联系: qq:121756557 email:121756557@qq.com IT数码