当前位置：移动技术网 > IT编程>数据库>其他数据库 > 去 HBase，Kylin on Parquet 性能表现如何？

去 HBase，Kylin on Parquet 性能表现如何？

2020年05月06日 | 移动技术网IT编程 | 我要评论

迟华琼,惠州市龙门县,防微杜渐的近义词

kylin on hbase 方案经过长时间的发展已经比较成熟，但也存在着局限性，因此，kyligence 推出了 kylin on parquet 方案（了解详情戳此处）。通过标准数据集测试，与仍采用 kylin on hbase 方案的 kylin 3.0 相比，kylin on parquet 的构建引擎性能有了很大的提升，对于复杂查询也有更好的性能表现。

本篇文章主要通过使用标准 ssb 数据集和 tpc-h 数据集，来分别获取 kylin on parquet 和 kylin 3.0 构建引擎以及查询引擎的性能数据，然后进行对比分析，让用户们能够更清楚地了解到当前 kylin on parquet 相对于 kylin 3.0（仍采用 kylin on hbase ）的优势和不足。

ssb（star schema benchmark）是一套用于测试数据库产品在星型模式下性能表现的基准测试规范，也是 olap 领域经常会用到的数据集。
tpc（transaction processing performance council，即事务处理性能委员会）有多种基准测试体系，在这里我们使用了 tpc-h 数据集。使用 tpc-h 的主要目的是测试数据库系统复杂查询的响应时间，以此来评价特定查询的决策支持能力。

kyligence 公司研发了适用于 kylin 的 ssb 和 tpc-h 数据集工具，并且包含了标准 sql，源码仓库地址如下：

https://github.com/kyligence/ssb-kylin
https://github.com/kyligence/kylin-tpch

测试环境配置

hadoop 集群：

4 个物理节点
yarn 队列拥有 400g 内存和 128 个 cpu 核数

kylin 3.0 使用的是 mapreduce 引擎。kylin on parquet 目前只支持内部定制版本的 spark 引擎，定制版相对于社区版主要是做了性能方面的优化，其他方面与社区版 spark 并没有区别。

spark 源码仓库https://github.com/kyligence/spark/tree/2.4.1-kylin-r3
spark 二进制包下载https://download-resource.s3.cn-north-1.amazonaws.com.cn/osspark/spark-2.4.1-os-kylin-r3

构建性能对比

over ssb

下面两个图分别表示构建时间和构建完成后占用存储空间的对比。我们可以看到在 ssb 6000 万和 9000 万数据量下，新的构建引擎构建速度快了一倍，最终占用存储空间也减少了接近一倍。

building duration over ssb result size over ssb

值得一提的是，kylin on parquet 最终构建的数据只包含 hdfs 上的数据，由于 kylin on hbase cuboid 文件构建完成之后 hdfs 上的文件需要转换为 hfile，而且为了 merge 准备，hdfs 上的数据默认是不会清除的，所以实际存储还会多一倍空间；而使用 parquet 后，只需要一份数据即可以用于查询，也可以用于 segment 合并，所以总体对比，kylin on parquet 的占用空间大约只有 kylin on hbase 存储的 1/3 到 1/4 ！

构建完成后前端页面会显示 cube 的大小，如下图所示：

kylin on parquet

△ kylin on parquet

kylin 3.0

△ kylin 3.0

查询性能对比

kylin on parquet 的查询引擎会在第一次查询的时候在 yarn 上创建一个常驻进程，专门用来处理查询任务，所以第一次查询会比较慢（初始化过程大约 20 秒），这里的测试并没有将第一次查询时间统计在内。

最近一周，查询引擎兼容性的问题也得到了进一步的修复，目前大部分 sql 查询包括 countdistinct, topn, percentile 等目前都已经能够支持。

我们使用 ssb 数据集（9000万行）和tpc-h（1200万行）官方标准 sql 进行查询响应时间测试，查询响应时间越低，查询引擎性能表现越好。两个数据集的标准查询 sql 可以在文章开始提到的 ssb 和 tpc-h 数据集工具仓库中找到。

over ssb

从下图中我们可以看到对于 ssb 数据集， kylin on parquet 查询响应要比 kylin 3.0 的要慢，但是大部分的查询还是能够在 1 秒内返回。

query response over ssb

over tpc-h

因为 tpc-h 的主要目的是测试数据库系统复杂查询的响应时间，所以 tpc-h 数据集的 sql 更加复杂，要求更高，从下图中可以看到 kylin on parquet 对查询复杂的 sql 处理时间更快，具有明显优势。

query response over tpc-h

总结

通过 kylin on parquet 和 kylin 3.0 查询构建引擎的性能对比数据我们能够看到，kylin on parquet 的构建引擎性能有了很大的提升，构建时间和存储空间都减少了接近一倍。从 ssb 数据集查询对比结果来看，查询引擎对于简单的查询请求和 kylin 3.0 有一定差距，但是大部分还是能够做到秒级响应。而对于 tpc-h 数据集测试使用的比较复杂的 sql 来说，一般后计算会比较多，新的查询引擎会有更好的性能表现。

目前， kylin on parquet 方案（了解详情戳此处）还处在不断完善的阶段，欢迎大家来体验。最后附上 github 仓库地址：https://github.com/kyligence/kylin-on-parquet-v2.git。

qrcode

大家有问题可以提 issue 和 pr，也欢迎大家加一下上图的微信群，一起讨论完善。

了解更多大数据资讯，点击进入kyligence官网

您可能感兴趣的文章:

如对本文有疑问，请在下面进行留言讨论，广大热心网友会与你互动！！点击进行留言回复

去 HBase，Kylin on Parquet 性能表现如何？

Kylin on HBase 方案经过长时间的发展已经比较成熟，但也存在着局限性，因此，Kyligence 推出了 Kylin on Parquet 方... [阅读全文]
如何找到Hive提交的SQL相对应的Yarn程序的applicationId

最近的工作是利用Hive做数据仓库的ETL转换，大致方式是将ETL转换逻辑写在一个hsql文件中，脚本当中都是简单的SQL语句，不包含判断、循环等存储过... [阅读全文]
HBase Filter 过滤器之RowFilter详解

前言：本文详细介绍了HBase RowFilter过滤器Java&Shell API的使用，并贴出了相关示例代码以供参考。RowFilter 基于行键... [阅读全文]
字符串相似度处理函数

oracle里面查比如存储过程里面与表SALES有关jobs: SELECT * FROM (SELECT a.name,upper(b.what)AS... [阅读全文]
如何在 HBase Shell 命令行正常查看十六进制编码的中文？哈哈~

今天比较开心，只想哈哈~哈哈哈~ 啥也不多说了，直接看示例吧！绝对比我口才好~ 哈哈！Get到了吗？好意思不帮我分享嘛~哈哈~ 转载请注明出处！欢迎关注... [阅读全文]
一小时搭建实时数据分析平台

实时数据分析门槛较高，我们如何用极少的开发工作就完成实时数据平台的搭建，做出炫酷的图表呢？如何快速的搭建实时数据分析平台，首先我们需要实时数据的接入端... [阅读全文]
Kylin on Parquet 介绍和快速上手

Apache Kylin on Apache HBase 方案经过长时间的发展已经比较成熟，但是存在着一定的局限性。因此，Kyligence 推出了 K... [阅读全文]
HBase Filter 过滤器之 Comparator 原理及源码学习

前言：上篇文章 "HBase Filter 过滤器概述" 对HBase过滤器的组成及其家谱进行简单介绍，本篇文章主要对HBase过滤器之比较器作一个补... [阅读全文]
hadoop 伪分布配置

配置 Hadoop 伪分布式任务配置说明: VMware 15 Centos 6.5 java -jdk 1.8 hadoop-2.6.0-cdh5.... [阅读全文]
安装 Hadoop 2.9.1 on Windows 10 64 bit (最全步骤整理)

1. Java 下载Java 1.8 64位版本https://java.com/en/download/. 如果不是64位java，在启动资源节点管理... [阅读全文]

网友评论


验证码：

去 HBase，Kylin on Parquet 性能表现如何？

2020年05月06日 | 移动技术网IT编程 | 我要评论

您可能感兴趣的文章:

相关文章:

网友评论