Hive 和 Spark的爱恨情仇恩怨交织

本文转载自微信公众号「明哥的IT随笔」，作者IT明哥。转载本文请联系明哥的IT随笔公。

本文转载自微信公众号「明哥的IT随笔」，作者IT明哥。转载本文请联系明哥的IT随笔公众号。

最近在面试一些应聘大数据岗位的技术小伙伴时，发现不少朋友对业界所谓的hive on spark和spark on hive分不太清楚;同时在日常工作中，也因为对这两个技术术语的理解不太一致，影响了进一步的技术交流。所以在这里，明哥想跟大家聊聊 hive 和 spark的爱恨情仇。

hive的定位

hive 官网有描述，“Apache Hive data warehouse software facilitates reading, writing, and managing large datasets residing in distributed storage using SQL.”，hive的定位是数据仓库，其提供了通过 sql 读写和管理分布式存储中的大规模的数据，即 hive即负责数据的存储和管理(其实依赖的是底层的hdfs文件系统或s3等对象存储系统)，也负责通过 sql来处理和分析数据。所以说，hive只用来处理结构化数据，且只提供了sql的方式来进行分析处理。而且一般来说，hive只能对数据进行批处理。(当使用hive 的hbase映射表时，有一定的实时能力;同时，flink社区也在尝试将hive实时化-这里的实时化指小时级别的实时化，达不到分钟级别)。

spark的定位

正如 spark官网所说，“Apache spark is a unified analytics engine for large-scale data processing.”，spark是一个通用的处理大规模数据的分析引擎，即 spark 是一个计算引擎，而不是存储引擎，其本身并不负责数据存储。其分析处理数据的方式，可以使用sql，也可以使用java,scala, python甚至R等api;其分析处理数据的模式，既可以是批处理，也可以是流处理;而其分析处理的数据，可以通过插件的形式对接很多数据源，既可以是结构化的数据，也可以是半结构化甚至分结构化的数据，包括关系型数据库RDBMS，各种nosql数据库如hbase, mongodb, es等，也包括文件系统hdfs，对象存储oss, s3 等等。

hive和spark: 碰撞出的爱恨交织恩怨情仇的火花

通过以上说明，我们可以看到spark和hive本质上是没有关系的，两者可以互不依赖。但是在企业实际应用中，经常把二者结合起来使用。而业界spark和hive结合使用的方式，主要有以下三种：

hive on spark。在这种模式下，数据是以table的形式存储在hive中的，用户处理和分析数据，使用的是hive语法规范的 hql (hive sql)。但这些hql，在用户提交执行时(一般是提交给hiveserver2服务去执行)，底层会经过hive的解析优化编译，最后以spark作业的形式来运行。事实上，hive早期只支持一种底层计算引擎，即mapreduce，后期在spark 因其快速高效占领大量市场后，hive社区才主动拥抱spark，通过改造自身代码，支持了spark作为其底层计算引擎。目前hive支持了三种底层计算引擎，即mr, tez和spark.用户可以通过set hive.execution.engine=mr/tez/spark来指定具体使用哪个底层计算引擎。 spark on hive。上文已经说到，spark本身只负责数据计算处理，并不负责数据存储。其计算处理的数据源，可以以插件的形式支持很多种数据源，这其中自然也包括hive。当我们使用spark来处理分析存储在hive中的数据时，这种模式就称为为 spark on hive。这种模式下，用户可以使用spark的 java/scala/pyhon/r 等api，也可以使用spark语法规范的sql ，甚至也可以使用hive 语法规范的hql 。而之所以也能使用hql，是因为 spark 在推广面世之初，就主动拥抱了hive，通过改造自身代码提供了原生对hql包括hive udf的支持(其实从技术细节来将，这里把hql语句解析为抽象语法书ast，使用的是hive的语法解析器，但后续进一步的优化和代码生成，使用的都是spark sql 的catalyst)，这也是市场推广策略的一种吧。 spark + spark hive catalog。这是spark和hive结合的一种新形势，随着数据湖相关技术的进一步发展，这种模式现在在市场上受到了越来越多用户的青睐。其本质是，数据以orc/parquet/delta lake等格式存储在分布式文件系统如hdfs或对象存储系统如s3中，然后通过使用spark计算引擎提供的scala/java/python等api或spark 语法规范的sql来进行处理。由于在处理分析时针对的对象是table, 而table的底层对应的才是hdfs/s3上的文件/对象，所以我们需要维护这种table到文件/对象的映射关系，而spark自身就提供了 spark hive catalog来维护这种table到文件/对象的映射关系。注意这里的spark hive catalog，其本质是使用了hive 的 metasore 相关 api来读写表到文件/对象的映射关系(以及一起其他的元数据信息)到 metasore db如mysql, postgresql等数据库中。(由于spark编译时可以把hive metastore api等相关代码一并打包到spark的二进制安装包中，所以使用这种模式，我们并不需要额外单独安装hive)。

{{userData.name}}已认证

Hive 和 Spark的爱恨情仇恩怨交织

微软史上第二大规模收购出炉：或于周一收购语音识别公司Nuance

Facebook 2020年为保护CEO扎克伯格安全花费了2300万美元

在华捞金千亿元的Nike，这次伤了赚钱“发动机”

旗舰焊门员来了！王腾：Redmi K70系列已进入全面量产阶段

大数据分析平台上线，辽宁智慧检务再发力

泡泡玛特就“女性面试需填生育计划”一事致歉称将积极改进

马斯克暗示特斯拉或已经出售所持比特币

IonQ 的俘获离子量子硬件现已在 Google Cloud Marketplace 上架