当前位置：网站首页 > 技术文章 > 正文

从零开始理解大数据架构之ETL数据采集中台DBus

ccwgpt 2024-10-31 12:25 42 浏览 0 评论

在开始今天的话题之前首先分享一下，我们的开发环境的大数据集群规划图，为上期的话题收尾。

规划原则只需要将组件服务和计算服务节点分离，这样就可以确保在计算过程中不出问题。

接下来我们来详细的聊聊ETL中的E,数据提取中台DBus，在上篇文章中，我已经讲解了，这个采集数据中台产生的背景及整体架构，以及安装部署和使用

1.DBus架构与工作原理

1.1贴源数据采集

DBUS源端数据采集大体来说分为两部分：

a.读取RDBMS增量日志的方式来实时获取增量数据日志，并支持全量拉取；

b.基于logtash，fume，Filebeat等抓取工具来实时获得数据，以可视化的方式对数据进行结构化输出；

以下为具体实现原理：

主要模块如下：

日志抓取模块：从RDBMS的备库中读取增量日志，并实时同步到kafka中；

增量转换模块：将增量数据实时转换为UMS数据，处理schema变更，脱敏等；

全量抽取程序：将全量数据从RDBMS备库拉取并转换为UMS数据；

日志算子处理模块：将来自不同抓取端的日志数据按照算子规则进行结构化处理；

心跳监控模块：对于RDMS类源，定时向源端发送心跳数据，并在末端进行监控，发送预警通知；

对于日志类，直接在末端监控预警。

web管理模块：管理所有相关模块。

1.2 多租户数据分发

对于不同租户对不同源端数据有不同访问权限、脱敏需求的情形，需要引入Router分发模块，将源端貼源数据，根据配置好的权限、用户有权获取的源端表、不同脱敏规则等，分发到分配给租户的

Topic。这一级的引入，在DBUS管理系统中，涉及到用户管理、Sink管理、资源分配、脱敏配置等。不同项目消费分配给他的topic。

2. 主要功能

无侵入方式接入多种数据源：业务系统无需任何修改，以无侵入性读取数据库系统的日志获得增

量数据实时变化。目前RDBMS支持mysql，oracle数据源（Oracle数据源请参考Oracle相关协

议），日志方面支持基于logstash，flflume和fifilebeat的多种数据日志抽取方案。

海量数据实时传输：使用基于Storm的流式计算框架，秒级延时，整体无单点保证高可用性。

多租户支持： 提供用户管理、资源分配、Topology管理、租户表管理等丰富的功能，可根据需

求，为不同租户分配不同的源端表数据访问权限，应用不同的脱敏规则，从而实现多租户资源隔

离、差异化数据安全

感知源端schema变更：当源端发生schema变更时，能自动感知schema变化，调整UMS版本

号，并通过Kafka消息和邮件通知下游

数据实时脱敏：可根据需求对指定列数据进行实时脱敏。脱敏策略包括：直接替换、MD5、

murmur等脱敏算法，脱敏加盐，正则表达式替换等。支持用户开发jar包实现DBUS未覆盖的个性

化脱敏策略。

初始化加载：支持高效的初始化加载和重新加载，支持任意指定输出topic，灵活应对客户需求。

统一标准化消息传输协议：使用统一的UMS(JSON格式)消息schema格式输出便于消费，提供数

据线级ums_id保证数据顺序性，输出insert,Update(before/after),Delete event数据。

可靠多路消息订阅分发：使用Kafka存储和传递消息保证可靠性和便捷的多用户订阅

支持分区表/系列表数据汇集：支持分区表的数据汇集到一个“逻辑表” 。也可将用户自定义的系列

表数据汇集到一个“逻辑表“。例：

实时监控&预警：可视化监控系统能随时查看各数据线实时流量和延时状况；当数据线发生异常

时，根据配置策略自动发邮件或短信通知相关负责人

3.DBus生产环境部署

3.1 准备工作

3.1.1 软件依赖

DBus依赖如下外部组件：

3.1.2 硬件及部署规划

硬件选择

基于公司HDP集群大数据集群8台机器node01-node08

软件选择

【Ambari托管】：DBus依赖的很多组件HDP3.1已经包含了，如果使用HDP包含的软件就叫做

Ambari托管(使用Ambari部署和管理)，只不过需要注意版本问题。

【跟Ambari共用】：有些软件可以跟Ambari公用，比如Ambari和DBus都需要用MySQL和Grafana，

但是这俩又不属于HDP软件栈，只不过需要注意版本问题。

【独立部署】：还有部分依赖软件需要独立部署。

部分软件直接使用HDP自带的组件，布署如下：

3.1.3 补充安装软件

DBus会用到zip，所以在各节点：

sudo yum -y install zip

3.1.4 版本兼容性问题

在正式部署一直我们要解决一个问题：DBus依赖的部分组件HDP正好有，但是版本不一样，只有先解

决版本兼容性问题才能使用HDP的组件，否则就只能单独安装。

一个比较好的方案是基于HDP自带软件版本重新编译DBus，特殊情况下还可能需要改源代码。

通过《3.1.2 硬件及部署规划》中的表我们看到DBus有两个依赖组件的版本需要升级：

Kafka0.10=>2.0.0

Storm1.0.2=>1.2.1

3.1.4.1 编译DBus源代码

首先我们了解下编译DBus，请跳转到《第6章编译DBus源代码》查看。

3.1.4.2 匹配HDP版本重新编译源代码

上小节我们知道了怎么编译DBus源代码，这一步我们只需要把对应软件的版本升级，然后编译即可。

项目根目录下的pom.xml修改如下内容：

3.2 基础软件安装

在安装Dbus前先安装Ambari+HDP3.1大数据集群及上面罗列的各个组件

3.3 DBus安装配置

3.3.2 下载DBus-Keeper

将我们通过源代码编译好的包deployer.zip上传到node01 并解压 unzip deployer.zip。

3.3.3 Nginx配置

复制deployer下的nginx.conf到Nginx的配置目录替换默认配置文件：

复制deployer下的build.zip到Nginx安装目录的html下解压(unzip build.zip)：

重启Nginx：

3.3.4 修改Dbus-Keeper启动配置

修改/home/hadoop/app/dbus/dbuskeeper_web/confifig.properties，提供dbus-keeper初始化启动

参数：

需要修改的是如下配置项( 一定要根据自己实际情况来改，不要死记)：

mkdir -p /home/hadoop/app/dbus

cd /home/hadoop/app/dbus

mv ~/deployer.zip .

unzip deployer.zip

# ZK地址换成我们自己安装zk，在node01上，端口2181

zk.str=node01:2181

# mysql管理库相关配置，其中mysql驱动可以不改

spring.datasource.driver-class-name=com.mysql.jdbc.Driver

spring.datasource.url=jdbc:mysql://node01:3306/dbusmgr?characterEncoding=utf-8

spring.datasource.username=dbusmgr

spring.datasource.password=dbusmgr%123

#kafka地址换成我们自己的

bootstrap.servers=node02:6667

bootstrap.servers.version=2.0.0

#influxdb地址:influxdb_url_web(外网地址),influxdb_url_dbus(内网地址),不区分内外网相同

即可

influxdb_url_web=http://node03:8086

influxdb_url_dbus=http://node03:8086

3.3.5 启动/停止Dbus-Keeper

3.3.6 初始化配置

启动之后等待1分钟，等系统完全启动后登录web: http://node03:8080 ，首次登陆会自动跳转到初始

化页面，如果没有自动进入请地址栏手动输入 http://node03:8080/login /init地址进入，根据页面提示

填写相关信息：

如上图所示，我们在/home/hadoop/app/dbus/dbuskeeper_web/confifig.properties配置的基本一些

配置信息已经带过来了，接下来先配置Grafana(如果基本配置没带过来，就多刷新几次)：

然后是Storm配置，如下图：

nginx.ip=node03

nginx.port=8080

初始化没有问题会跳转至登录页， 输入用户名密码即可开启DBus之旅。管理员初始账号/密码：

admin/12345678：

3.3.7 检查heartbeat

根据DBus-Keeper的初始化配置，它已经在node02和node03的/home/hadoop/app/dbus/下安装了

heartbeat，去检查下heartbeat进程在不在，如果不在的话用如下命令手工启动：

cd /home/hadoop/app/dbus/dbus-heartbeat-0.5.0;

nohup ./heartbeat.sh >/dev/null 2>&1 &

通过DBus-Keeper界面可以检查系统状态：

3.3.8 检查表是否创建成功

应该创建29张表，以前2张可能会创建不成功，需要手工创建：

CREATE TABLE `t_data_tables` (

`id` int(11) unsigned NOT NULL AUTO_INCREMENT,

`ds_id` int(11) unsigned NOT NULL COMMENT 't_dbus_datasource 表ID',

`schema_id` int(11) unsigned NOT NULL COMMENT 't_tab_schema 表ID',

`schema_name` varchar(64) DEFAULT NULL,

`table_name` varchar(64) NOT NULL DEFAULT '' COMMENT '表名',

`table_name_alias` varchar(64) NOT NULL DEFAULT '' COMMENT '别名',

`physical_table_regex` varchar(96) DEFAULT NULL,

`output_topic` varchar(96) DEFAULT '' COMMENT 'kafka_topic',

`ver_id` int(11) unsigned DEFAULT NULL COMMENT '当前使用的meta版本ID',

`status` varchar(32) NOT NULL DEFAULT 'abort' COMMENT

'ok,abort,inactive,waiting\r\nok:正常使用;abort:需要抛弃该表的数据;waiting:等待拉全

量;inactive:不可用 ',

`create_time` timestamp NULL DEFAULT CURRENT_TIMESTAMP ON UPDATE

CURRENT_TIMESTAMP COMMENT '创建时间',

`meta_change_flg` int(1) DEFAULT '0' COMMENT 'meta变更标识，初始值为：0，表示代表没

有发生变更，1：代表meta发生变更。该字段目前mysql appender模块使用。',

`batch_id` int(11) DEFAULT '0' COMMENT '批次ID，用来标记拉全量的批次，每次拉全量会

++，增量只使用该字段并不修改',

`ver_change_history` varchar(128) DEFAULT NULL,

`ver_change_notice_flg` int(1) NOT NULL DEFAULT '0',

`output_before_update_flg` int(1) NOT NULL DEFAULT '0',

`description` varchar(128) DEFAULT NULL,

`fullpull_col` varchar(255) DEFAULT '' COMMENT '全量分片列:配置column名称',

`fullpull_split_shard_size` varchar(255) DEFAULT '' COMMENT '全量分片大小配置:配

置-1代表不分片',

`fullpull_split_style` varchar(255) DEFAULT '' COMMENT '全量分片类型:MD5',

`is_open` int(1) DEFAULT '0' COMMENT 'mongo是否展开节点,0不展开,1一级展开',

`is_auto_complete` tinyint(4) DEFAULT '0' COMMENT 'mongoDB的表是否补全数据；如果开

启，增量中更新操作会回查并补全数据',

PRIMARY KEY (`id`),

UNIQUE KEY `idx_sid_tabname` (`schema_id`,`table_name`) USING BTREE

) ENGINE=InnoDB DEFAULT CHARSET=utf8;

sudo chmod o+w /usr/hdp/3.1.4.0-315/storm/

好了，今天的分享就先到这，如果是使用中遇到什么问题，可以与我交流，我将竭力为你解决，让我一起成长，

下期预告：DBus的深入使用及MySQL数据源接入DBus

记得评论，转发我，谢谢。

流式计算框架

上一篇：用上流批一体的实时数仓，数据导入和查询速度起飞了
下一篇：解密淘宝推荐实战，打造“比你还懂你”的个性化APP

从零开始理解大数据架构之ETL数据采集中台DBus

相关推荐

取消回复欢迎你发表评论:

使用cheat engine修改unity游戏（cheat engine教程）

1分钟了解Tableau

(转载)Python爬虫框架Scrapy入门与实践

钉钉打卡虚拟定位赶快点赞收藏吧!

超级硬核的钉钉模拟wifi，定位，远程打卡教程

足不出户便能环游世界!手机发微信朋友圈如何定位到国外?

6米跨度柱子一般多大?框架结构的柱子应该设置多大?

项目使用 Jfrog Artifactory 制品库

.NET 多版本 WinForm 开源控件库 SunnyUI 技术解析与示例代码

美国陆军游骑兵和长程侦察巡逻部队军服图册

从零开始理解大数据架构之ETL数据采集中台DBus

相关推荐

取消回复欢迎 你 发表评论:

使用cheat engine修改unity游戏（cheat engine教程）

1分钟了解Tableau

(转载)Python爬虫框架Scrapy入门与实践

钉钉打卡虚拟定位赶快点赞收藏吧!

超级硬核的钉钉模拟wifi，定位，远程打卡教程

足不出户便能环游世界!手机发微信朋友圈如何定位到国外?

6米跨度柱子一般多大?框架结构的柱子应该设置多大?

项目使用 Jfrog Artifactory 制品库

.NET 多版本 WinForm 开源控件库 SunnyUI 技术解析与示例代码

美国陆军游骑兵和长程侦察巡逻部队军服图册

取消回复欢迎你发表评论: