摘要：第九届中国数据库技术大会，阿里巴巴技术专家孟庆义对阿里HBase的数据管道设施实践与演进进行了讲解。主要从数据导入场景、 HBase Bulkload功能、HImporter系统、数据导出场景、HExporter系统这些部分进行了讲述。
数十款阿里云产品限时折扣中，赶快点击这里，领券开始云上实践吧
直播视频请点击
精彩视频整理：

数据导入场景

生意参谋

生意参谋是一种为商家服务，帮助商家进行决策和运营的数据产品。如在淘宝或天猫上开一家店，生意参谋会提供店里每天进入的流量、转化率、客户的画像和同行业进行对比这些数据属于什么位置。商家可以根据流量分析、活动分析和行业分析去进行决策。可以根据平时日志、点击量和访问量，数据库把数据通过实时的流处理写入HBase。有一部分写到离线系统里，定期做一些清洗和计算再写入HBase，然后供业务去查询 HBase。

蚂蚁风控

在蚂蚁上任何一笔交易支付都会调用风控，风控主要是去看这次交易是否属于同一个设备，是否是经常交易的地点，以及交易的店铺信息。它必须在100ms—200ms把风险做完，风控是根据长期的历史信息、近期历史的信息和实时的信息三个方向做综合考量。用户的输入会实时的写入HBase，同时这个实时的信息增量也会导入到离线系统里面，离线系统会定期的对数据进行计算，计算的数据结果会作为历史或近期历史再写回HBase，一个支付可能会调百十次的风控，而且需要在百毫秒内进行返回。

数据导入需要解决的问题

2013年刚刚开始做数据导入的时候面临的更多的是功能需求性的问题，现在需要考虑的是导入的周期性调度、异构数据源多、导入效率高和多集群下的数据一致性的问题。前两个问题更适合由平台化去解决，HBase的数据导入更关注的是导入效率和多集群下的数据的一致性。

什么是Bulkload？Bulkload有什么功能？

阿里HBase的数据管道设施实践与演进

Bulkload使用的是一种新的结构LSM Tree进行写入更新，其结构如上图所示。使用Application code 进行数据写入，数据会被写入到MemStore，MemStore在HBase里是一个跳表，可以把它看成一个有序的列表，并不断往里面插入数据。当数据达到一定量时就会启动flush对数据进行编码和压缩，并写成HFile。HFile是由索引块和数据块组成的文件结构，其特点是只读性，生成HFile之后就不可改了。当用户进行读取数据的时候，就会从三个HFile和一个MemStore进行查找进行读取。这个结构的优化就是就把随机的写变成了有序的写。Bulkload就可以把上千上万条数据在毫秒内加入到HBase里。所以Bulkload的优势如下：

原文链接